5 ИИ-моделей, 1 спецификация: кто лучше декомпозирует?

16 февраля 2026

Декомпозиция задач — узкое место ИИ-разработки. Если агент получает расплывчатый план, он пишет расплывчатый код. Если получает чётко изолированную подзадачу — работает на уровне senior-инженера.

Задача: воспроизвести функциональность существующего сервиса HTTPS Security Checker — взять работающий продукт, составить детальную спецификацию его поведения и отдать её пяти разным ИИ-моделям на декомпозицию в реализуемые подзадачи.

Мы оценили полученные планы по 17 критериям. Результаты показали два принципиально разных подхода к ИИ-разработке.

Эксперимент

Мы взяли существующий сервис HTTPS Security Checker и составили по нему детальную продуктовую спецификацию: анализ конфигурации TLS, валидность сертификатов, заголовки безопасности, HSTS, безопасность DNS, поддержка HTTP/3, обнаружение смешанного контента и проверка HTTPS-редиректов. Спецификация включала 8 модулей проверки, систему оценок, возможности экспорта и требования к развёртыванию.

Каждая модель сформировала полный план декомпозиции — направленный ациклический граф (DAG) подзадач с зависимостями, списками файлов и критериями приёмки.

Модели

МодельАгентРазмер планаПодзадачиВремяСтоимость
GPT-5.3Copilot CLI~44 КБ19~6 минПлатно
Claude OpusClaude Code~110 КБ15~13 минПлатно
KimiKilocode~65 КБ206 мин 12 сек$0.46
GLM-5Kilocode~206 КБ1626 мин 14 секБесплатно
MiniMax-25Kilocode~15 КБ16~3 минБесплатно

Opus потратил ~13 минут, но параллельно запускал рой субагентов. GLM-5 и MiniMax-25 работали на бесплатных тарифах через Kilocode. Kimi обошёлся всего в $0.46 и при этом попал в топ-3. Codex через Copilot CLI уложился примерно в 6 минут — сопоставимо с Kimi, хотя и на платном тарифе.

Методология оценки

Каждый план оценивался по 17 критериям, сгруппированным в 7 взвешенных категорий:

КатегорияВесЧто оценивалось
Качество декомпозиции20%Гранулярность, корректность графа зависимостей, принцип единственной ответственности
Полнота спецификации файлов и критериев20%Покрытие путей к файлам, качество критериев приёмки
Руководство по реализации20%Примеры кода, стратегия тестирования, практическая реализуемость
Соответствие спецификации15%Покрытие всех 8 модулей проверки
Безопасность и отказоустойчивость10%Обработка ошибок, защита от SSRF, ограничение частоты запросов
Фронтенд и экспорт10%Покрытие UI, детализация экспорта в PDF/JSON/CSV
DevOps и развёртывание5%Docker, cron-очистка, конфигурация продакшена

Каждый критерий оценивался от 1 до 10 баллов, затем взвешивался в итоговую оценку.

Результаты

МестоМодельБаллФилософия разработки
1Codex / GPT-5.38.77Директивный — ноль кода, максимум структуры
2Claude Opus8.45С упором на реализацию — 33 блока кода
3Kimi8.43Сбалансированный — структура плюс детали
4GLM-58.30Насыщенный реализацией — 206 КБ руководства
5MiniMax-255.13Схематичный — недостаточно для передачи в работу

Ключевые выводы

Codex / GPT-5.3 (8.77 балла)

Codex выдал самый дисциплинированный план. Каждая из 19 задач отвечает строго за одну зону ответственности. Пути к файлам указаны полностью (127+ файлов), каждая задача содержит 3 исполняемые команды верификации (проверка типов, тесты, grep). Ограничение на абстракцию репозитория повторяется дословно в каждой задаче.

Обратная сторона: ноль блоков TypeScript-кода. План чисто директивный — описывает что строить, но не как. Нет отдельной задачи на Docker/развёртывание, нет CI/CD-пайплайна.

Claude Opus (8.45 балла)

Opus пошёл противоположным путём: 33 блока TypeScript-кода с почти готовыми реализациями. Разработчик может начать кодить сразу. В плане 80+ конкретных тест-кейсов, полноценная задача на Docker и детальная логика калькулятора оценок.

Обратная сторона: всего 15 задач. Пять модулей проверки объединены в 2 задачи, что нарушает принцип единственной ответственности. При 7.3 КБ на задачу некоторые подзадачи могут не уместиться в контекстное окно агента.

Kimi (8.43 балла)

Kimi нашёл золотую середину между структурой и детализацией: 20 чётко ограниченных задач. Принцип единственной ответственности соблюдён, предоставлены сигнатуры интерфейсов, включены реальные тестовые домены (badssl.com). Деталей реализации чуть меньше, чем у Opus или GLM, но архитектурная строгость выше.

GLM-5 (8.30 балла)

GLM сгенерировал самый объёмный результат — 206 КБ. Инженер мог бы начать реализацию только по TypeBox-схемам и паттернам. Однако HTTP/3 и Mixed Content объединены в одну задачу, задача API-сервера перегружена (10+ файлов), а PDF-экспорт оставлен как TODO.

MiniMax-25 (5.13 балла)

При 0.9 КБ на задачу планы MiniMax — это наброски. Нет примеров кода, нет исполняемых критериев приёмки, списки файлов неполные. Исполнителю пришлось бы по сути заново проектировать решение.

Лоб в лоб: Codex vs Opus

Два лучших плана воплощают принципиально разные подходы к проектированию:

ХарактеристикаCodex / GPT-5.3Claude Opus
Философия разработкиМаксимально директивный, без кодаМаксимально детальный, с готовым кодом
Количество задач19 (строгое разделение ответственности)15 (есть задачи с несколькими зонами ответственности)
Объём44 КБ (~2.3 КБ/задача)110 КБ (~7.3 КБ/задача)
Блоки TypeScript-кода033
Оптимален дляИИ-агентов, генерирующих код по спецификацииРазработчиков, которые хотят взять готовое и адаптировать
Верификация3 исполняемые команды на задачу11 проверяемых критериев на задачу
Единственная ответственностьИдеальное соблюдение5 модулей объединены в 2 задачи
Docker/развёртываниеМинимальноКомплексно

Что упустили все планы

Ни один план — ни одной модели — не покрывает:

  • Слой кэширования (кэширование результатов в Redis по домену)
  • Документация OpenAPI / Swagger
  • CI/CD-пайплайн как отдельная задача
  • Мониторинг и observability (структурированное логирование, метрики, трейсинг)
  • Стратегия отката миграций БД
  • Нагрузочное тестирование
  • Проверка отзыва сертификатов (CRL) — покрыт только OCSP stapling

Рекомендации

Для ИИ-агентных workflow (Codex, Claude Code, Cursor): берите планы в стиле Codex. Строгая изоляция задач, дословные ограничения и команды верификации заточены под автономных агентов, которые сами генерируют код.

Для разработчиков: берите планы в стиле Opus. 33 блока кода и детальные спецификации снимают неоднозначность и позволяют сразу приступить к реализации.

Гибридный подход: возьмите граф из 19 задач Codex как каркас проекта, добавьте в каждую задачу блоки кода и тест-кейсы от Opus, включите реальные тестовые домены Kimi в критерии приёмки и закройте пробелы, которые упустили все планы (кэширование, CI/CD, OpenAPI).

Лучшая декомпозиция зависит от того, кто — или что — будет реализовывать задачи. Проектируйте планы под своего исполнителя.


Строите ИИ-агентные workflow? Узнавайте об обновлениях VibeCoder Heretic.

Читайте также

01

Представляем VibeCoder Heretic - Сделайте 90% Кодинга Чужой Проблемой

Анонс VibeCoder Heretic - boilerplate для автономных агентов программирования, который работает на вашей инфраструктуре. Полный рабочий процесс с PR, Kanban-досками и отслеживанием в реальном времени.

Читать далее