Приёмка экономии 1.11 на Codex
Дата наблюдения: 2026-10-01. Исходная ревизия протокола: 72862321c50a1dc47005c551d719734a1b8d31be.
Вердикт
Инструментирование готово, но цель «минус 30% токенов на принятую задачу без потери качества» пока не доказана. Шесть замороженных baseline-ячеек были зафиксированы как unmeasured; пересобирать удобную исходную линию после оптимизаций запрещено. Платный синтетический повтор не запускался. Релиз-кандидат должен сохранять этот результат как inconclusive, а не превращать отсутствие сопоставимой пары в экономию.
Что теперь измеряется точно
Нативный журнал Codex связывает response ID с явным успешным task start и закрывает окно только после успешного результата task done. Неудачные попытки закрытия и работа между ними остаются в стоимости. В итог попадают только задачи со статусом done в базе проекта. Fork history, вложенные/незаконченные окна и ответы вне границ остаются без атрибуции. В кэш не пишутся prompt, команды или tool output.
На текущем снимке найдено 16 завершённых задач с точной атрибуцией и 934 их response rounds. Ещё 1421 проектный ответ исключён из task rollup как не имеющий надёжной принятой границы. Общий проектный поток: 306 122 827 input, включая 298 660 352 cached input (97,6%), и 1 019 479 output. Это подтверждает главный рычаг: каждый лишний модельный ход снова оплачивает большой кэшированный префикс.
Квота аккаунта выросла с 57% в исходном снимке до 92% к 18:46 UTC. Это account-wide наблюдение для всех проектов, поэтому оно не является стоимостью только TAUSIK и не используется как множитель цены.
Модели
Наблюдаемые задачи GPT-5.6 Sol (n=4) дали медиану 7 417 530,5 total tokens; GPT-5.6 Terra (n=12) — 3 329 801,5. Эти задачи различались по сложности, требованиям и числу повторов. У GPT-6 Astra нет ни одной завершённой задачи с точной границей в этом наборе. Поэтому нельзя утверждать, что Astra расходует «двойные токены», или что Terra даёт измеренный процент экономии.
Рабочая политика остаётся практической: корневая сложная задача — GPT-5.6 Sol Medium; ограниченные simple/medium worker-задачи — GPT-5.6 Terra Medium; Astra — только для риска, который оправдывает отдельную дорогую проверку. Переключение делается новым worker на границе задачи, не заменой модели посреди корневой сессии.
Проверка рычагов
Первые три полезные Codex-задачи после правила compound read дали смешанный результат. В complex-наблюдении calls снизились с 104,5 до 72, а reads с 47,5 до 41. В medium calls выросли с 25 до 40, reads — с 14 до 17. У simple не было сопоставимой исходной линии. Общая медиана трёх задач изменилась с 51 до 41 calls, но read-медиана осталась 25. Правило сохранено, потому что поведенческий тест доказывает замену двух независимых reads одним compound call с сохранением обоих результатов; экономия на уровне задач ему не приписывается.
Форма ответов Codex: 10 post-rule сессий, 9 полезных, 35 финальных ответов; median 183 слова, p90 256. Evidence median равна нулю, а outcome/completeness не измеряются, поэтому baseline не понижен и улучшение качества не заявлено.
Условие следующего решения
Следующая оценка использует только естественно возникшую задачу, совпавшую с одним из шести замороженных кейсов, с теми же model/reasoning/speed и независимой приёмкой. Максимум одна новая попытка на сложность. При drift идентичности, регрессии качества или ненадёжной сумме эксперимент останавливается.
Продолжение по решению владельца: расходы на принятую задачу
Порядок: r111-bound-start-handoff → ограниченная диагностика существующего r111-live-enforcement-capabilities (30–45 минут, до 20 вызовов) → r111-workflow-cost-audit (одно улучшение по офлайн-замеру) → r111-natural-cost-validation. Новая инфраструктура телеметрии и несвязанные исследования заморожены. Внешние трекеры не изменялись.
На замороженном ответе /start сессии #279: 33 599 → 4 367 UTF-8 байт, −87,0%. Самые крупные поля handoff: working_tree 11 151, verify 5 930, completed 4 841 байт. Сводка handoff сохраняет предупреждения и следующие шаги, а полный источник доступен отдельным существующим инструментом. Если важные инструкции не поместились, сводка требует полного чтения перед продолжением. Замер: .tausik/planning/release-111/session-open-measurement-20261001.json. Это уменьшение ответа на одинаковых данных, не процент экономии задачи.
Live Codex исправлен и повторно проверен: шесть отказов до мутации и три разрешённые записи на CLI 0.153.4; см. результаты и границы. Проверен code-mode и literal Set-Content. Standalone transport и произвольные shell-программы остаются unknown.
Следующий офлайн-аудит workflow
В 14 проектных Codex-трассах (39,3 МБ источников) результаты outer calls, содержащих чтения файлов, заняли 5 745 411 байт в 338 вызовах; результаты с поиском — 4 830 158 байт в 256; с task show — 662 784 байта в 59. Один outer call может содержать несколько действий, поэтому эти числа являются верхними границами кандидатов и могут пересекаться. Pytest дал ещё 672 186 байт, но это обязательная проверка, а не выбранный overhead. Отдельно от call mix остаются 1421 неатрибутированный проектный response и 934 rounds принятых задач.
Выбрано одно ограниченное улучшение: bounded task package теперь несёт полный план с состоянием каждого шага, а /task использует package mode для обычного статуса и проверки плана. На неизменной завершённой задаче полный ответ — 16 371 байт, package до изменения — 5 052, после добавления плана — 5 490. Итог относительно полного ответа: −66,5%, при этом все 4 шага и их done сохранены. Число model rounds этим замером не измеряется. Full mode остаётся для явно названного поля, которого нет в package. Платных прогонов не было.
Готовность 1.11 по расходам остаётся HOLD / inconclusive: уменьшение конкретных payload доказано, снижение стоимости принятой задачи на 30% ещё нет.
Естественная приёмка стоимости
Повторный нативный снимок Codex сделан без генерации benchmark-задач. В нём 2604 проектных ответа: 337 699 140 input, включая 329 602 048 cached input, 1 115 285 output и 329 818 reasoning output. Точные границы есть у 18 принятых задач: 1036 ответов, 134 371 615 total tokens, 34 попытки и 16 повторов. Отдельно остались 1557 неатрибутированных task responses и 1568 исключённых строк. Эти расходы не распределялись по удобным задачам задним числом. Account quota наблюдалась, но не приписывалась проекту.
Из 18 задач 17 имеют одну model/reasoning/speed identity; смешанная live-probe-scope исключена. Для Terra Medium Standard n=12, медиана total 3 329 801,5; для Sol Medium Standard n=5, медиана 5 318 895. Это разные задачи, а не matched pairs, поэтому разница не является эффектом модели или оптимизации. У Astra нет принятой single-identity задачи в этом снимке.
Шесть заранее замороженных ячеек S1/S2/M1/M2/C1/C2 остаются unmeasured. Ни одна естественная задача не образовала пару с тем же case, complexity, model, reasoning, standard speed и теми же quality checks. Результат цели «−30% на принятую задачу» поэтому inconclusive, sample size сравнимых пар равен нулю. Базовая линия не достраивалась после оптимизаций.
Итог готовности: live-enforcement blocker Codex закрыт для проверенной версии и ограниченного синтаксиса; Claude остаётся на автоматических регрессиях, GLM — теоретическая совместимость по Decision #414. Выпуск 1.11 по утверждённому экономическому критерию — HOLD: корректность улучшений доказана, целевой процент стоимости нет. Для смены этого вердикта нужна естественная matched pair либо отдельное решение владельца изменить критерий выпуска. Такой пары в этой работе не создавали. GitLab #10, commit, push и release не выполнялись.
Инженерная приёмка релизного дерева
После устранения пяти регрессий scoped tausik verify прошёл как run #3301: все блокирующие gates зелёные, pytest охватил 63 из 650 test-файлов; hadolint был явно пропущен. Подготовка verify теперь передаёт ruff format только .py и .pyi: найденный на реальном прогоне случай повреждения tausik/gates.json закрыт отрицательным тестом.
Default lane: 12 733 passed, 35 skipped, 143 deselected, 153,19 с. Отдельная slow lane: 143 passed, 12 768 deselected, 126,23 с. Вместе обе дорожки выполнили все собранные тесты; skipped остаются объявленным остатком, а не доказанной функциональностью. Артефакты: .tausik/planning/release-111/full-pytest-rerun-20261001.log и .tausik/planning/release-111/slow-pytest-20261001.log.
Инженерная матрица готова к выпуску в пределах указанных host-границ. Итоговый release verdict остаётся HOLD исключительно по утверждённому экономическому критерию: matched pairs по стоимости принятой задачи по-прежнему 0, поэтому снижение на 30% не доказано.