Оценки ИИ-агентов

Результаты оценки ИИ-агентов на задачах генерации кода Nuxt: процент успеха и время выполнения.
Открыть на GitHubДата последнего запуска: 3 июля 2026 г.

Результаты оценки агентов

МодельАгентСр. длительностьУспешностьС первого раза
Claude Sonnet 5
Claude Code292.09s100%100%
Cursor Composer 2.0
Cursor273.91s100%97%
Claude Fable 5
Claude Code298.81s100%97%
GPT 5.3 Codex (xhigh)
Codex276.52s100%90%
Gemini 3 Pro Preview
OpenCode291.65s100%90%
Claude Opus 4.8
Claude Code261.37s100%90%
Kimi K2.7 Code
OpenCode327.00s100%83%
GPT 5.5 Pro
Codex666.02s97%93%
Cursor Composer 2.5
Cursor263.31s97%90%
Claude Opus 4.7
Claude Code215.73s97%90%
MiniMax M3
OpenCode224.89s97%86%
Gemini 3.1 Pro Preview
OpenCode289.46s97%83%
Claude Opus 4.6
Claude Code244.85s97%83%
Claude Sonnet 4.6
Claude Code254.11s93%83%
Kimi K2.6
OpenCode285.47s93%79%
GPT 5.4 (xhigh)
Codex302.57s90%76%
Claude Sonnet 4.5
Claude Code240.76s59%48%
MiniMax M2.7
OpenCode204.88s48%31%
На каждую оценку даётся до 4 попыток. Успешность — доля оценок, пройденных хотя бы с одной попытки; С первого раза — доля, пройденных сразу; помогает сравнивать модели при одинаковой успешности. Ср. длительность — среднее время агента на одну оценку. Разверните строку, чтобы увидеть детали: бейдж 1/3 значит, что оценка провалилась дважды, а прошла с третьей попытки.