---
title: "5 ИИ-моделей, 1 спецификация: кто лучше декомпозирует?"
description: "Мы дали одну и ту же спецификацию HTTPS Security Checker пяти моделям: Codex/GPT-5.3, Claude Opus, Kimi, GLM-5 и MiniMax-25. Вот как они набрали баллы по 17 критериям — и что упустили все планы."
canonical: https://giglabo.com/ru/blog/ai-model-comparison-task-decomposition
locale: ru
---

# 5 ИИ-моделей, 1 спецификация: кто лучше декомпозирует?

> Markdown twin of https://giglabo.com/ru/blog/ai-model-comparison-task-decomposition
> Fetch this instead of the HTML page: same content, a fraction of the bytes.
> Site structure and the full page list for agents: https://giglabo.com/llms.txt

Мы дали одну и ту же спецификацию HTTPS Security Checker пяти моделям: Codex/GPT-5.3, Claude Opus, Kimi, GLM-5 и MiniMax-25. Вот как они набрали баллы по 17 критериям — и что упустили все планы.

*16 февраля 2026*

Декомпозиция задач — узкое место ИИ-разработки. Если агент получает расплывчатый план, он пишет расплывчатый код. Если получает чётко изолированную подзадачу — работает на уровне senior-инженера.

Задача: воспроизвести функциональность существующего сервиса HTTPS Security Checker — взять работающий продукт, составить детальную спецификацию его поведения и отдать её пяти разным ИИ-моделям на декомпозицию в реализуемые подзадачи.

Мы оценили полученные планы по 17 критериям. Результаты показали два принципиально разных подхода к ИИ-разработке.

## Эксперимент

Мы взяли существующий сервис HTTPS Security Checker и составили по нему детальную продуктовую спецификацию: анализ конфигурации TLS, валидность сертификатов, заголовки безопасности, HSTS, безопасность DNS, поддержка HTTP/3, обнаружение смешанного контента и проверка HTTPS-редиректов. Спецификация включала 8 модулей проверки, систему оценок, возможности экспорта и требования к развёртыванию.

Каждая модель сформировала полный план декомпозиции — направленный ациклический граф (DAG) подзадач с зависимостями, списками файлов и критериями приёмки.

### Модели

| Модель | Агент | Размер плана | Подзадачи | Время | Стоимость |
|--------|-------|-------------|:---------:|-------|-----------|
| GPT-5.3 | Copilot CLI | ~44 КБ | 19 | ~6 мин | Платно |
| Claude Opus | Claude Code | ~110 КБ | 15 | ~13 мин | Платно |
| Kimi | Kilocode | ~65 КБ | 20 | 6 мин 12 сек | $0.46 |
| GLM-5 | Kilocode | ~206 КБ | 16 | 26 мин 14 сек | Бесплатно |
| MiniMax-25 | Kilocode | ~15 КБ | 16 | ~3 мин | Бесплатно |

Opus потратил ~13 минут, но параллельно запускал рой субагентов. GLM-5 и MiniMax-25 работали на бесплатных тарифах через Kilocode. Kimi обошёлся всего в $0.46 и при этом попал в топ-3. Codex через Copilot CLI уложился примерно в 6 минут — сопоставимо с Kimi, хотя и на платном тарифе.

## Методология оценки

Каждый план оценивался по 17 критериям, сгруппированным в 7 взвешенных категорий:

| Категория | Вес | Что оценивалось |
|-----------|:---:|-----------------|
| Качество декомпозиции | 20% | Гранулярность, корректность графа зависимостей, принцип единственной ответственности |
| Полнота спецификации файлов и критериев | 20% | Покрытие путей к файлам, качество критериев приёмки |
| Руководство по реализации | 20% | Примеры кода, стратегия тестирования, практическая реализуемость |
| Соответствие спецификации | 15% | Покрытие всех 8 модулей проверки |
| Безопасность и отказоустойчивость | 10% | Обработка ошибок, защита от SSRF, ограничение частоты запросов |
| Фронтенд и экспорт | 10% | Покрытие UI, детализация экспорта в PDF/JSON/CSV |
| DevOps и развёртывание | 5% | Docker, cron-очистка, конфигурация продакшена |

Каждый критерий оценивался от 1 до 10 баллов, затем взвешивался в итоговую оценку.

## Результаты

| Место | Модель | Балл | Философия разработки |
|:-----:|--------|:----:|----------------------|
| 1 | **Codex / GPT-5.3** | **8.77** | Директивный — ноль кода, максимум структуры |
| 2 | **Claude Opus** | **8.45** | С упором на реализацию — 33 блока кода |
| 3 | **Kimi** | **8.43** | Сбалансированный — структура плюс детали |
| 4 | **GLM-5** | **8.30** | Насыщенный реализацией — 206 КБ руководства |
| 5 | **MiniMax-25** | **5.13** | Схематичный — недостаточно для передачи в работу |

## Ключевые выводы

### Codex / GPT-5.3 (8.77 балла)

Codex выдал самый дисциплинированный план. Каждая из 19 задач отвечает строго за одну зону ответственности. Пути к файлам указаны полностью (127+ файлов), каждая задача содержит 3 исполняемые команды верификации (проверка типов, тесты, grep). Ограничение на абстракцию репозитория повторяется дословно в каждой задаче.

Обратная сторона: ноль блоков TypeScript-кода. План чисто директивный — описывает *что* строить, но не *как*. Нет отдельной задачи на Docker/развёртывание, нет CI/CD-пайплайна.

### Claude Opus (8.45 балла)

Opus пошёл противоположным путём: 33 блока TypeScript-кода с почти готовыми реализациями. Разработчик может начать кодить сразу. В плане 80+ конкретных тест-кейсов, полноценная задача на Docker и детальная логика калькулятора оценок.

Обратная сторона: всего 15 задач. Пять модулей проверки объединены в 2 задачи, что нарушает принцип единственной ответственности. При 7.3 КБ на задачу некоторые подзадачи могут не уместиться в контекстное окно агента.

### Kimi (8.43 балла)

Kimi нашёл золотую середину между структурой и детализацией: 20 чётко ограниченных задач. Принцип единственной ответственности соблюдён, предоставлены сигнатуры интерфейсов, включены реальные тестовые домены (badssl.com). Деталей реализации чуть меньше, чем у Opus или GLM, но архитектурная строгость выше.

### GLM-5 (8.30 балла)

GLM сгенерировал самый объёмный результат — 206 КБ. Инженер мог бы начать реализацию только по TypeBox-схемам и паттернам. Однако HTTP/3 и Mixed Content объединены в одну задачу, задача API-сервера перегружена (10+ файлов), а PDF-экспорт оставлен как TODO.

### MiniMax-25 (5.13 балла)

При 0.9 КБ на задачу планы MiniMax — это наброски. Нет примеров кода, нет исполняемых критериев приёмки, списки файлов неполные. Исполнителю пришлось бы по сути заново проектировать решение.

## Лоб в лоб: Codex vs Opus

Два лучших плана воплощают принципиально разные подходы к проектированию:

| Характеристика | Codex / GPT-5.3 | Claude Opus |
|----------------|-----------------|-------------|
| Философия разработки | Максимально директивный, без кода | Максимально детальный, с готовым кодом |
| Количество задач | 19 (строгое разделение ответственности) | 15 (есть задачи с несколькими зонами ответственности) |
| Объём | 44 КБ (~2.3 КБ/задача) | 110 КБ (~7.3 КБ/задача) |
| Блоки TypeScript-кода | 0 | 33 |
| Оптимален для | ИИ-агентов, генерирующих код по спецификации | Разработчиков, которые хотят взять готовое и адаптировать |
| Верификация | 3 исполняемые команды на задачу | 11 проверяемых критериев на задачу |
| Единственная ответственность | Идеальное соблюдение | 5 модулей объединены в 2 задачи |
| Docker/развёртывание | Минимально | Комплексно |

## Что упустили все планы

Ни один план — ни одной модели — не покрывает:

- **Слой кэширования** (кэширование результатов в Redis по домену)
- **Документация OpenAPI / Swagger**
- **CI/CD-пайплайн** как отдельная задача
- **Мониторинг и observability** (структурированное логирование, метрики, трейсинг)
- **Стратегия отката миграций БД**
- **Нагрузочное тестирование**
- **Проверка отзыва сертификатов (CRL)** — покрыт только OCSP stapling

## Рекомендации

**Для ИИ-агентных workflow** (Codex, Claude Code, Cursor): берите планы в стиле Codex. Строгая изоляция задач, дословные ограничения и команды верификации заточены под автономных агентов, которые сами генерируют код.

**Для разработчиков**: берите планы в стиле Opus. 33 блока кода и детальные спецификации снимают неоднозначность и позволяют сразу приступить к реализации.

**Гибридный подход**: возьмите граф из 19 задач Codex как каркас проекта, добавьте в каждую задачу блоки кода и тест-кейсы от Opus, включите реальные тестовые домены Kimi в критерии приёмки и закройте пробелы, которые упустили все планы (кэширование, CI/CD, OpenAPI).

Лучшая декомпозиция зависит от того, кто — или что — будет реализовывать задачи. Проектируйте планы под своего исполнителя.

---

Строите ИИ-агентные workflow? Узнавайте об обновлениях VibeCoder Heretic.

## Related

- HTML version of this page: https://giglabo.com/ru/blog/ai-model-comparison-task-decomposition
- Site map for agents: https://giglabo.com/llms.txt
