prism
Отчёт по ревью · PR #70

Четыре модели.
Три раунда ревью.

Оценки, доказательства и затраченное время рядом. Все результаты из трёх тредов собраны на одной странице, без нового пересчёта качества.

Сравнивайте внутри раунда. Критерии и веса между заданиями различаются. Средний балл не вычисляется. Время включает чтение, команды и ожидания, а thinking обозначает заданный режим, не измеренную вычислительную нагрузку.
Σ

Общий итог · время и результат

Сколько заняли три первоначальных ревью у каждой модели. Последующие исправления и повторные ревью не включены.

Время из исходных отчётов
Время каждой модели за три раунда
МодельСуммарное времяСреднее на ревьюСамое короткое / долгоеБаллы 01 / 02 / 03
Sol 6.151 мин 41 с17 мин 14 с17:08 / 17:239,0 / 9,0 / 8,2
Sonnet 52 ч 45 мин 34 с55 мин 11 с23:08 / 1:17:148,0 / 7,3 / 8,9
GLM 5.31 ч 48 мин 59 с36 мин 20 с22:03 / 46:136,0 / 6,5 / 5,7
Grok 4.716 мин 12 с5 мин 24 с4:01 / 7:204,0 / 4,7 / 6,7

Суммы рассчитаны из опубликованных длительностей, средние округлены до секунды. Это прошедшее время задач, не стоимость, не CPU-время и не чистое thinking.

Sol 6.1
51:41
Sonnet 5
2:45:34
GLM 5.3
1:48:59
Grok 4.7
16:12

Sol · стабильное время и высокие оценки

Все три ревью заняли около 17 минут. Разница между самым коротким и самым долгим всего 15 секунд. В двух раундах лучший балл у Sol, в третьем он второй.

Sonnet · полезный вклад, но долгое ожидание

В первом раунде нашёл две уникальные принятые проблемы за 23 мин 08 с. В третьем получил лучший балл 8,9, но затратил 1 ч 17 мин 14 с. Суммарно три задачи заняли в 3,2 раза больше времени, чем у Sol.

Grok · быстрее всех, вердикт нужно проверять

От 4 до 7 минут на ревью. Самое короткое время в каждом раунде, но оценки 4,0 и 4,7 в первых двух. В третьем за 4 мин 51 с воспроизведён главный дефект процессов, оценка 6,7.

GLM · долго, без лучшего результата

В первых двух раундах работал 46 и 40 минут. В первом подтвердил две принятые проблемы, без уникальных находок. В третьем время сократилось до 22 минут, но оценка составила 5,7.

Когда завершился последний ревьювер
Параллельный раундПервый завершившийсяПоследний завершившийсяОриентир ожидания всего раунда
01 · Review PR 70Grok · 7:20GLM · 46:1346 мин 13 с
02 · ПаритетGrok · 4:01Sonnet · 1:05:121 ч 05 мин 12 с
03 · РеференсыGrok · 4:51Sonnet · 1:17:141 ч 17 мин 14 с
Параллельное ожидание не равно сумме времени моделей. Здесь ориентир равен самой долгой задаче каждого раунда при почти одновременном старте. Точная длительность от первого старта до последнего завершения может отличаться. Причины задержек по этим данным неизвестны.

Что видно
по этим раундам

Sol получил 9,0, 9,0 и 8,2 балла при длительности около 17 минут в каждом задании. Sonnet добавил полезные независимые находки и получил лучший балл в третьем раунде, но его время сильно различалось.

Grok каждый раз завершал первым. GLM давал дополнительные подтверждения, но ни в одном из трёх раундов не получил лучший балл. Это результаты конкретных запусков, а не универсальный рейтинг моделей.