← Блог
8 июля 2026 г.6 minai

Встреча, на которой три часа выбирали модель. А потом всё равно взяли ту, которую я предложил в начале

Про один проект, который задержался на семь недель из-за того, что команда не могла договориться, кого использовать - Claude, ChatGPT, Gemini или локалку. И про то, как это обычно лечится.


Встреча была во вторник. В Zoom - шестеро: CTO, два бэкендера, продакт, безопасник и я. Вопрос на повестке - один: «какую модель возьмём для feature X».

Через три часа встреча кончилась без решения. Был выбран формат «ещё подумаем до пятницы». К пятнице никто не подумал, потому что на неделе случился прод-инцидент, и всем стало не до выбора моделей.

Через следующие шесть недель мы собирались по этому вопросу четыре раза. Каждый раз прибавлялся новый аргумент - «вот вышла новая Sonnet», «вот у Gemini теперь два миллиона контекста», «вот локалка Llama 3.3 теперь на бенчмарках чуть-чуть лучше GPT-4o на специфической задаче, которая нам, вообще-то, нерелевантна». Feature X эти семь недель не двигалась никуда.

На седьмой неделе мне надоело. Я сказал: «вы возьмите Claude Sonnet, сделайте прототип за три дня на ваших двадцати реальных примерах, и посмотрим». Они так и сделали. Прототип работал. Они взяли Claude Sonnet. До сих пор работает. Feature X поехала.

Думаю, эти семь недель стоили клиенту примерно миллион рублей упущенного времени четырёх человек. Плюс просевшая мотивация команды, которую я считать не умею, но по ощущению она потянула не меньше.


Это - типичная история, которая повторяется у меня по два-три раза в год. Выбор модели - это такая задача, в которой очень легко утонуть, потому что:

  • новые модели выходят каждые три-четыре месяца,
  • бенчмарки переворачиваются,
  • каждый разработчик в команде имеет своё мнение («я попробовал Gemini в личном, мне понравилось»),
  • отраслевые блоги пишут статьи типа «почему GPT-4o превзошёл Claude в задачах X» (и, разумеется, следом - «почему Claude превзошёл GPT-4o в задачах Y»),
  • и никто в команде не хочет первым сказать «да всё равно, возьмём вот эту», потому что это звучит непрофессионально.

В результате вместо работы команда обсуждает инструменты. И это само по себе было бы нормально, если бы такая дискуссия имела смысл. Но чаще всего - не имеет.


Бенчмарки, по которым спорят о моделях, - это MMLU, GPQA, HumanEval и прочая синтетика. Они меряют, насколько хорошо модель справляется со стандартными абстрактными задачами. Это вам, вероятно, нерелевантно. Вам нужно знать, справится ли эта конкретная модель с вашей конкретной задачей за разумные деньги. Проверяется это за полдня на ваших данных, не за семь недель на обсуждениях.


Когда я всё же упираюсь - потому что клиент хочет «обоснованное решение», а не «я сказал так» - я разделяю модели примерно так.

Claude (Sonnet / Opus) - длинные контексты, задачи с нюансированной инструкцией, рефакторинг, работа с текстом, где важна точность. Я использую его для большей части своих рабочих сценариев, потому что он, во-первых, дисциплинирован (следует инструкции), и, во-вторых, редко галлюцинирует на фактах, которых не знает (он, как правило, честно об этом пишет). Минус - дороже на токен. Средний проект - $50-200 в месяц при нормальной нагрузке.

ChatGPT (GPT-4o / o-серия) - мультимодальность, реальное время, чат-интерфейсы для конечных пользователей. Большая экосистема плагинов. Минус - галлюцинации на редких фактах заметнее, чем у Claude. Этого мало кто пишет в статьях, но я за год убедился в этом сам несколько раз, в том числе с репутационными последствиями для одного клиента, который чуть не отправил email с выдуманным исследованием.

Gemini (2.x) - если вся компания живёт в Google Workspace, это кратчайший путь. Длинные контексты (в 2026, правда, уже не уникальные). Хорош на мультимодальных задачах с графиками. Минус - экосистема. За пределами Google он ощущается как чужая кухня.

Локальные (Llama 3.x, Mistral, Qwen) - приватность, стоимость при больших объёмах, edge-сценарии. Если вы отдаёте данные, которые нельзя отдавать ни в какое облако - вопрос закрыт, берите локалку. Минус - нужен инженер, сервер и GPU. И разница в качестве с флагманами на сложных задачах в 2026 всё ещё заметная.


Я для себя свожу выбор к трём вопросам, причём в этом порядке:

Первое - приватность. Если нельзя отдавать - локалка. Дальше не читаем.

Второе - объём. Если больше 100 000 запросов в день - либо локалка, либо самая дешёвая API-модель. Здесь считаешь стоимость на реальной нагрузке.

Третье - всё остальное - берёшь Claude или ChatGPT, прогоняешь 20 примеров, берёшь победителя. Три часа работы вместо трёх недель.


Одна из вещей, которую я, как внешний человек, часто говорю клиентам:

  • Не мигрируйте между моделями каждые три месяца «потому что вышла новее». Стабильность стоит больше, чем 2% на бенчмарке. Каждая миграция - это переписывание промптов, перенастройка, тестирование. И это работа, которая не приносит никакой дополнительной ценности - клиенту всё равно, Sonnet 3.5 у вас или Sonnet 4.

Один клиент в этом году потратил две недели на миграцию с Sonnet на Opus, потому что «Opus теперь умнее». Через месяц мы обнаружили, что для их задачи Opus не заметно умнее, зато в три раза дороже. Мигрировали обратно. Ещё неделя. Минус три недели разработки.

(На самом деле хорошо, что вернулись. Хуже - если бы остались.)


Модель - инструмент под конкретную задачу, а не предмет веры. В 2026 инструментов много, они примерно сравнимы, выбор делается за полдня на своих данных, а не за три часа встречи с шестью людьми по Zoom.

Если ваша встреча «о выборе модели» длится больше часа - значит, обсуждаете вы не модели, а страх выбрать неправильно. Это другая проблема, и бенчмарками она не решается.

Mike Fluff← Блог