Четыре модели.
Три раунда ревью.
Оценки, доказательства и затраченное время рядом. Все результаты из трёх тредов собраны на одной странице, без нового пересчёта качества.
Общий итог · время и результат
Сколько заняли три первоначальных ревью у каждой модели. Последующие исправления и повторные ревью не включены.
| Модель | Суммарное время | Среднее на ревью | Самое короткое / долгое | Баллы 01 / 02 / 03 |
|---|---|---|---|---|
| Sol 6.1 | 51 мин 41 с | 17 мин 14 с | 17:08 / 17:23 | 9,0 / 9,0 / 8,2 |
| Sonnet 5 | 2 ч 45 мин 34 с | 55 мин 11 с | 23:08 / 1:17:14 | 8,0 / 7,3 / 8,9 |
| GLM 5.3 | 1 ч 48 мин 59 с | 36 мин 20 с | 22:03 / 46:13 | 6,0 / 6,5 / 5,7 |
| Grok 4.7 | 16 мин 12 с | 5 мин 24 с | 4:01 / 7:20 | 4,0 / 4,7 / 6,7 |
Суммы рассчитаны из опубликованных длительностей, средние округлены до секунды. Это прошедшее время задач, не стоимость, не CPU-время и не чистое thinking.
Sol · стабильное время и высокие оценки
Все три ревью заняли около 17 минут. Разница между самым коротким и самым долгим всего 15 секунд. В двух раундах лучший балл у Sol, в третьем он второй.
Sonnet · полезный вклад, но долгое ожидание
В первом раунде нашёл две уникальные принятые проблемы за 23 мин 08 с. В третьем получил лучший балл 8,9, но затратил 1 ч 17 мин 14 с. Суммарно три задачи заняли в 3,2 раза больше времени, чем у Sol.
Grok · быстрее всех, вердикт нужно проверять
От 4 до 7 минут на ревью. Самое короткое время в каждом раунде, но оценки 4,0 и 4,7 в первых двух. В третьем за 4 мин 51 с воспроизведён главный дефект процессов, оценка 6,7.
GLM · долго, без лучшего результата
В первых двух раундах работал 46 и 40 минут. В первом подтвердил две принятые проблемы, без уникальных находок. В третьем время сократилось до 22 минут, но оценка составила 5,7.
| Параллельный раунд | Первый завершившийся | Последний завершившийся | Ориентир ожидания всего раунда |
|---|---|---|---|
| 01 · Review PR 70 | Grok · 7:20 | GLM · 46:13 | 46 мин 13 с |
| 02 · Паритет | Grok · 4:01 | Sonnet · 1:05:12 | 1 ч 05 мин 12 с |
| 03 · Референсы | Grok · 4:51 | Sonnet · 1:17:14 | 1 ч 17 мин 14 с |
Что видно
по этим раундам
Sol получил 9,0, 9,0 и 8,2 балла при длительности около 17 минут в каждом задании. Sonnet добавил полезные независимые находки и получил лучший балл в третьем раунде, но его время сильно различалось.
Grok каждый раз завершал первым. GLM давал дополнительные подтверждения, но ни в одном из трёх раундов не получил лучший балл. Это результаты конкретных запусков, а не универсальный рейтинг моделей.