Skip to content

1.11: повторный замер формы ответов Codex ​

Дата: 2026-10-01. Решение владельца #414: количественное принятие 1.11 сосредоточено на Codex. Claude и его 162 / 365 остаются историческим контекстом; Kilo/GLM не образуют количественную предпосылку релиза.

Что измерено ​

Native-журнал Codex хранит реплики не в Claude-конверте, а как response_item: начало хода — message с ролью user, видимый ответ — message с ролью assistant и блоком output_text. Вложенные agent_message, tool calls и reasoning не считаются ответом владельцу.

После публикации правил 2026-09-29 22:44 UTC найдены десять новейших сессий этого репозитория. Все начались после публикации; девять содержат не менее трёх пользовательских ходов и двух ответов. Команда из свежего дерева:

text
python scripts/project.py metrics answers --host codex --last 10 --json

дала 35 финальных ответов: медиана 183 слова, p90 256, verdict-first 45,7%, медиана доказательств 0 слов, медиана промежуточного текста 17 слов на ход. Непарсируемых файлов нет.

Вывод и границы ​

Это первый провайдер-специфичный ориентир Codex, сохранённый как answer_shape.codex_observation. Он намеренно не стал ratchet и не меняет Claude 162 / 365: между хостами нельзя переносить порог, а подходящей до-правильной когорты Codex нет.

Сокращение p90 по сравнению с историческим Claude не является доказательством улучшения. Измеритель не наблюдает успешность задачи или полноту ответа, а evidence_words_median = 0 не подтверждает сохранение доказательств в форме, которую он умеет распознать. Следующий замер Codex сравнивает этот же host с этой же формой данных; при росте чисел ориентир не двигается. Понижать его можно только вместе с отдельным доказательством outcome, evidence и material limitations.

Проверка реализации ​

tests/test_answer_rules_every_prompt.py содержит поведенческую проверку: native Codex ответ разбивается по пользовательским ходам, а сообщение сотрудничающего агента не попадает ни в финал, ни в промежуточный текст.