Содержание

Три оси решения

Выбор модели сводится к балансу трёх вещей:

  • Возможности. Какой уровень рассуждений, кодинга, работы с контекстом реально нужен задаче.
  • Скорость. Насколько быстро нужен ответ. У Opus есть fast mode (до 2.5x скорости вывода за премиальную цену), но это отдельный рычаг.
  • Стоимость. Бюджет на разработку и на прод отдельно.

К ним добавляется четвёртый, более тонкий рычаг — effort у свежих Opus и Sonnet. Часто настроить усилие внутри модели выгоднее, чем менять модель.

Подход 1: снизу вверх

Для многих приложений оптимально стартовать с быстрой и дешёвой модели:

  1. Начать на Claude Haiku 4.5.
  2. Прогнать реальный сценарий, а не игрушечные промпты.
  3. Сверить качество с вашими критериями приёмки.
  4. Подниматься выше только при конкретной нехватке возможностей.

Когда это лучший путь: прототипирование, жёсткие требования к латентности, чувствительность к стоимости, высокий объём простых задач. Если Haiku проходит вашу планку — вы нашли модель, остановитесь.

Подход 2: сверху вниз

Для сложных задач, где интеллект первичен, разумнее начать с потолка и потом оптимизировать вниз:

  1. Реализовать на Claude Opus 4.8.
  2. Отточить промпты под модель.
  3. Проверить, что качество устраивает.
  4. Снижать стоимость позже: уменьшать effort или спускаться на модель ниже по мере отладки пайплайна.

Когда это лучший путь: сложное рассуждение, научные и математические задачи, нюансированное понимание, продвинутый кодинг и высокоавтономные агенты, случаи где точность перевешивает цену.

Матрица выбора

Коротко, под что какой уровень брать как стартовый:

Когда нужно Стартовать с Примеры
Максимум Opus-уровня: сложное рассуждение, долгий агентный кодинг, высокая автономия Opus 4.8 Многочасовые автономные агенты, крупный рефакторинг, системная инженерия, vision-тяжёлые сценарии
Фронтирный интеллект на масштабе для кода, агентов и продакшена Sonnet 4.6 Генерация кода, анализ данных, контент, работа с инструментами
Почти фронтир с максимальной скоростью по самой выгодной цене Haiku 4.5 Реалтайм, объёмная обработка, чувствительные к цене задачи, подзадачи агентов

Как решать про апгрейд: бенчмарки, а не ощущения

Главная ошибка — менять модель по интуиции «кажется, тупит». Правильный процесс:

  1. Соберите свой набор бенчмарков под конкретную задачу. Хороший eval-набор это самый важный шаг.
  2. Тестируйте на реальных промптах и данных, не на абстрактных.
  3. Сравните модели по точности ответов, качеству, обработке краевых случаев.
  4. Взвесьте компромисс производительности и цены.
# Скелет простого сравнения моделей на своём наборе
import anthropic

client = anthropic.Anthropic()
MODELS = ["claude-haiku-4-5", "claude-sonnet-4-6", "claude-opus-4-8"]

def run(model, prompt):
    r = client.messages.create(
        model=model, max_tokens=1024,
        messages=[{"role": "user", "content": prompt}],
    )
    return r.content[0].text

for m in MODELS:
    passed = sum(check(run(m, case.prompt), case.expected) for case in eval_set)
    print(m, passed, "/", len(eval_set))

Когда у вас есть цифры по своему набору, решение «хватает ли Haiku или нужен Sonnet» перестаёт быть спором о вкусах.

Что дальше

В третьей части — про деньги: из чего складывается счёт, и пять рычагов, которые сжимают эффективную стоимость: кэширование промптов, батч-API, маршрутизация по моделям, контроль контекста и география инференса.

Поделиться: