5 ИИ-моделей, 1 спецификация: кто лучше декомпозирует?
16 февраля 2026
Декомпозиция задач — узкое место ИИ-разработки. Если агент получает расплывчатый план, он пишет расплывчатый код. Если получает чётко изолированную подзадачу — работает на уровне senior-инженера.
Задача: воспроизвести функциональность существующего сервиса HTTPS Security Checker — взять работающий продукт, составить детальную спецификацию его поведения и отдать её пяти разным ИИ-моделям на декомпозицию в реализуемые подзадачи.
Мы оценили полученные планы по 17 критериям. Результаты показали два принципиально разных подхода к ИИ-разработке.
Эксперимент
Мы взяли существующий сервис HTTPS Security Checker и составили по нему детальную продуктовую спецификацию: анализ конфигурации TLS, валидность сертификатов, заголовки безопасности, HSTS, безопасность DNS, поддержка HTTP/3, обнаружение смешанного контента и проверка HTTPS-редиректов. Спецификация включала 8 модулей проверки, систему оценок, возможности экспорта и требования к развёртыванию.
Каждая модель сформировала полный план декомпозиции — направленный ациклический граф (DAG) подзадач с зависимостями, списками файлов и критериями приёмки.
Модели
Модель
Агент
Размер плана
Подзадачи
Время
Стоимость
GPT-5.3
Copilot CLI
~44 КБ
19
~6 мин
Платно
Claude Opus
Claude Code
~110 КБ
15
~13 мин
Платно
Kimi
Kilocode
~65 КБ
20
6 мин 12 сек
$0.46
GLM-5
Kilocode
~206 КБ
16
26 мин 14 сек
Бесплатно
MiniMax-25
Kilocode
~15 КБ
16
~3 мин
Бесплатно
Opus потратил ~13 минут, но параллельно запускал рой субагентов. GLM-5 и MiniMax-25 работали на бесплатных тарифах через Kilocode. Kimi обошёлся всего в $0.46 и при этом попал в топ-3. Codex через Copilot CLI уложился примерно в 6 минут — сопоставимо с Kimi, хотя и на платном тарифе.
Методология оценки
Каждый план оценивался по 17 критериям, сгруппированным в 7 взвешенных категорий:
Категория
Вес
Что оценивалось
Качество декомпозиции
20%
Гранулярность, корректность графа зависимостей, принцип единственной ответственности
Полнота спецификации файлов и критериев
20%
Покрытие путей к файлам, качество критериев приёмки
Обработка ошибок, защита от SSRF, ограничение частоты запросов
Фронтенд и экспорт
10%
Покрытие UI, детализация экспорта в PDF/JSON/CSV
DevOps и развёртывание
5%
Docker, cron-очистка, конфигурация продакшена
Каждый критерий оценивался от 1 до 10 баллов, затем взвешивался в итоговую оценку.
Результаты
Место
Модель
Балл
Философия разработки
1
Codex / GPT-5.3
8.77
Директивный — ноль кода, максимум структуры
2
Claude Opus
8.45
С упором на реализацию — 33 блока кода
3
Kimi
8.43
Сбалансированный — структура плюс детали
4
GLM-5
8.30
Насыщенный реализацией — 206 КБ руководства
5
MiniMax-25
5.13
Схематичный — недостаточно для передачи в работу
Ключевые выводы
Codex / GPT-5.3 (8.77 балла)
Codex выдал самый дисциплинированный план. Каждая из 19 задач отвечает строго за одну зону ответственности. Пути к файлам указаны полностью (127+ файлов), каждая задача содержит 3 исполняемые команды верификации (проверка типов, тесты, grep). Ограничение на абстракцию репозитория повторяется дословно в каждой задаче.
Обратная сторона: ноль блоков TypeScript-кода. План чисто директивный — описывает что строить, но не как. Нет отдельной задачи на Docker/развёртывание, нет CI/CD-пайплайна.
Claude Opus (8.45 балла)
Opus пошёл противоположным путём: 33 блока TypeScript-кода с почти готовыми реализациями. Разработчик может начать кодить сразу. В плане 80+ конкретных тест-кейсов, полноценная задача на Docker и детальная логика калькулятора оценок.
Обратная сторона: всего 15 задач. Пять модулей проверки объединены в 2 задачи, что нарушает принцип единственной ответственности. При 7.3 КБ на задачу некоторые подзадачи могут не уместиться в контекстное окно агента.
Kimi (8.43 балла)
Kimi нашёл золотую середину между структурой и детализацией: 20 чётко ограниченных задач. Принцип единственной ответственности соблюдён, предоставлены сигнатуры интерфейсов, включены реальные тестовые домены (badssl.com). Деталей реализации чуть меньше, чем у Opus или GLM, но архитектурная строгость выше.
GLM-5 (8.30 балла)
GLM сгенерировал самый объёмный результат — 206 КБ. Инженер мог бы начать реализацию только по TypeBox-схемам и паттернам. Однако HTTP/3 и Mixed Content объединены в одну задачу, задача API-сервера перегружена (10+ файлов), а PDF-экспорт оставлен как TODO.
MiniMax-25 (5.13 балла)
При 0.9 КБ на задачу планы MiniMax — это наброски. Нет примеров кода, нет исполняемых критериев приёмки, списки файлов неполные. Исполнителю пришлось бы по сути заново проектировать решение.
Лоб в лоб: Codex vs Opus
Два лучших плана воплощают принципиально разные подходы к проектированию:
Характеристика
Codex / GPT-5.3
Claude Opus
Философия разработки
Максимально директивный, без кода
Максимально детальный, с готовым кодом
Количество задач
19 (строгое разделение ответственности)
15 (есть задачи с несколькими зонами ответственности)
Объём
44 КБ (~2.3 КБ/задача)
110 КБ (~7.3 КБ/задача)
Блоки TypeScript-кода
0
33
Оптимален для
ИИ-агентов, генерирующих код по спецификации
Разработчиков, которые хотят взять готовое и адаптировать
Верификация
3 исполняемые команды на задачу
11 проверяемых критериев на задачу
Единственная ответственность
Идеальное соблюдение
5 модулей объединены в 2 задачи
Docker/развёртывание
Минимально
Комплексно
Что упустили все планы
Ни один план — ни одной модели — не покрывает:
Слой кэширования (кэширование результатов в Redis по домену)
Документация OpenAPI / Swagger
CI/CD-пайплайн как отдельная задача
Мониторинг и observability (структурированное логирование, метрики, трейсинг)
Стратегия отката миграций БД
Нагрузочное тестирование
Проверка отзыва сертификатов (CRL) — покрыт только OCSP stapling
Рекомендации
Для ИИ-агентных workflow (Codex, Claude Code, Cursor): берите планы в стиле Codex. Строгая изоляция задач, дословные ограничения и команды верификации заточены под автономных агентов, которые сами генерируют код.
Для разработчиков: берите планы в стиле Opus. 33 блока кода и детальные спецификации снимают неоднозначность и позволяют сразу приступить к реализации.
Гибридный подход: возьмите граф из 19 задач Codex как каркас проекта, добавьте в каждую задачу блоки кода и тест-кейсы от Opus, включите реальные тестовые домены Kimi в критерии приёмки и закройте пробелы, которые упустили все планы (кэширование, CI/CD, OpenAPI).
Лучшая декомпозиция зависит от того, кто — или что — будет реализовывать задачи. Проектируйте планы под своего исполнителя.
Анонс VibeCoder Heretic - boilerplate для автономных агентов программирования, который работает на вашей инфраструктуре. Полный рабочий процесс с PR, Kanban-досками и отслеживанием в реальном времени.