Введение: почему мы перестали верить обычным сравнениям
Большинство сравнительных обзоров ИИ‑агентов для кодинга построены на простых промптах и поверхностной оценке по скриншоту. Мы решили пойти дальше. Вместо синтетического теста мы поставили двум ведущим инструментам — Claude Code на Fable 5 и Codex на GPT‑5.6 — реальную бизнес‑задачу. Ожидалось, что эксперимент подтвердит привычные стереотипы за двадцать минут. В реальности всё оказалось иначе, и результаты по‑настоящему удивили.
Методология: одна продуктовая идея и час на реализацию
Исходные условия были сознательно жёсткими, чтобы исключить субъективность. Каждому агенту выдали одну и ту же идею продукта и ровно один час на сборку. Инструкции готовили по единому шаблону — различие было только в движке: Claude Code работал на модели Fable 5, а Codex — на свежем GPT‑5.6. Задача: создать аналитический инструмент, способный обрабатывать «грязные» экспорты данных о бронировании паромов и превращать их в читаемые отчёты.
Я настроил строгие правила осознанно: одна и та же продуктовая идея, около часа на создание, идентичный метод подготовки техзадания. Один агент завершил всё без пауз и уложился в лимит. Второй постоянно запрашивал разрешения, занял в полтора раза больше времени, но выдал самый полный продукт из всех, что я когда‑либо получал от кодинг‑агента, — включая работающую страницу логина.
Ход эксперимента: автономность против пошагового контроля
Claude Code: бесшовный спринт
Агент на основе Fable 5 действовал практически без остановок. Он молча принял техзадание, самостоятельно спланировал архитектуру мини‑приложения и реализовал весь функционал в рамках отведённого часа. Никаких уточнений или запросов разрешения не потребовалось. Результат — работоспособный прототип аналитического модуля, способный парсить и визуализировать данные.
Codex: медлительный перфекционист с неожиданным финалом
Codex на GPT‑5.6 действовал принципиально иначе. Он постоянно инициировал диалог: уточнял формат полей, спрашивал разрешение на изменение структуры, перепроверял логику. Время реализации выросло примерно в полтора раза. Однако именно такой «придирчивый» подход позволил собрать более зрелый продукт: агент самостоятельно добавил полноценную страницу входа в систему, продумал обработку исключений и сделал интерфейс заметно дружелюбнее.
Результаты: скорость против глубины
Claude Code блестяще справился с задачей на скорость, создав минимально жизнеспособный продукт строго по ТЗ. Codex внешне выглядел менее эффективным из‑за постоянных пауз, но его итоговая работа оказалась значительно более проработанной. Фактически мы получили не «почти одинаковые поделки», а два совершенно разных подхода к решению одной задачи. Назвать это ничьей было бы профессиональной нечестностью.
По итогам дня я дважды кардинально менял мнение. Один агент завершил сборку без единого перерыва. Второй просил разрешений и сильно затянул дедлайн, но при этом создал самый завершённый продукт в моей практике. К концу теста я не мог честно сказать, что это была ничья.
Практические выводы для маркетинга и автоматизации
Для бизнеса такие эксперименты — не развлечение, а прямой путь к оптимизации рутинных процессов. Представьте, что подобный агент за час собирает дашборд для анализа лидов из разных источников или пайплайн обработки неструктурированных экспортов. В нашем маркетинговом агентстве Dragon Farm мы регулярно проверяем новейшие ИИ‑решения в боевых задачах, чтобы рекомендовать клиентам действительно работающие связки.
Оба испытанных подхода имеют прикладную ценность. Когда важнее скорость итераций и минимальное вмешательство человека, более автономный агент вроде Claude Code выглядит предпочтительнее. Если же цель — создать продукт, близкий к промышленной эксплуатации, терпеливый и дотошный Codex даёт ощутимый выигрыш по качеству. Именно такие нюансы мы учитываем, когда занимаемся настройкой сквозной аналитики и лидгена для клиентов. Автоматически сгенерированный аналитический инструмент может быть немедленно встроен в контур сбора и обработки маркетинговых данных.
Отдельно стоит отметить, как подобные эксперименты ускоряют внедрение автономных цифровых сотрудников. В нашей практике внедрение ИИ‑агентов и n8n воркфлоу часто начинается именно с такого лабораторного теста: даём агенту реальный датасет и смотрим, способен ли он самостоятельно построить работающий отчётный модуль. Опыт сравнения Claude Code и Codex наглядно показывает — выбор между «быстро закрыть задачу» и «сделать фундаментально» лежит в поле стратегических приоритетов команды, а не технических ограничений инструментов.