Содержание
Три оси решения
Выбор модели сводится к балансу трёх вещей:
- Возможности. Какой уровень рассуждений, кодинга, работы с контекстом реально нужен задаче.
- Скорость. Насколько быстро нужен ответ. У Opus есть fast mode (до 2.5x скорости вывода за премиальную цену), но это отдельный рычаг.
- Стоимость. Бюджет на разработку и на прод отдельно.
К ним добавляется четвёртый, более тонкий рычаг — effort у свежих Opus и Sonnet. Часто настроить усилие внутри модели выгоднее, чем менять модель.
Подход 1: снизу вверх
Для многих приложений оптимально стартовать с быстрой и дешёвой модели:
- Начать на Claude Haiku 4.5.
- Прогнать реальный сценарий, а не игрушечные промпты.
- Сверить качество с вашими критериями приёмки.
- Подниматься выше только при конкретной нехватке возможностей.
Когда это лучший путь: прототипирование, жёсткие требования к латентности, чувствительность к стоимости, высокий объём простых задач. Если Haiku проходит вашу планку — вы нашли модель, остановитесь.
Подход 2: сверху вниз
Для сложных задач, где интеллект первичен, разумнее начать с потолка и потом оптимизировать вниз:
- Реализовать на Claude Opus 4.8.
- Отточить промпты под модель.
- Проверить, что качество устраивает.
- Снижать стоимость позже: уменьшать
effortили спускаться на модель ниже по мере отладки пайплайна.
Когда это лучший путь: сложное рассуждение, научные и математические задачи, нюансированное понимание, продвинутый кодинг и высокоавтономные агенты, случаи где точность перевешивает цену.
Матрица выбора
Коротко, под что какой уровень брать как стартовый:
| Когда нужно | Стартовать с | Примеры |
|---|---|---|
| Максимум Opus-уровня: сложное рассуждение, долгий агентный кодинг, высокая автономия | Opus 4.8 | Многочасовые автономные агенты, крупный рефакторинг, системная инженерия, vision-тяжёлые сценарии |
| Фронтирный интеллект на масштабе для кода, агентов и продакшена | Sonnet 4.6 | Генерация кода, анализ данных, контент, работа с инструментами |
| Почти фронтир с максимальной скоростью по самой выгодной цене | Haiku 4.5 | Реалтайм, объёмная обработка, чувствительные к цене задачи, подзадачи агентов |
Как решать про апгрейд: бенчмарки, а не ощущения
Главная ошибка — менять модель по интуиции «кажется, тупит». Правильный процесс:
- Соберите свой набор бенчмарков под конкретную задачу. Хороший eval-набор это самый важный шаг.
- Тестируйте на реальных промптах и данных, не на абстрактных.
- Сравните модели по точности ответов, качеству, обработке краевых случаев.
- Взвесьте компромисс производительности и цены.
# Скелет простого сравнения моделей на своём наборе
import anthropic
client = anthropic.Anthropic()
MODELS = ["claude-haiku-4-5", "claude-sonnet-4-6", "claude-opus-4-8"]
def run(model, prompt):
r = client.messages.create(
model=model, max_tokens=1024,
messages=[{"role": "user", "content": prompt}],
)
return r.content[0].text
for m in MODELS:
passed = sum(check(run(m, case.prompt), case.expected) for case in eval_set)
print(m, passed, "/", len(eval_set))
Когда у вас есть цифры по своему набору, решение «хватает ли Haiku или нужен Sonnet» перестаёт быть спором о вкусах.
Что дальше
В третьей части — про деньги: из чего складывается счёт, и пять рычагов, которые сжимают эффективную стоимость: кэширование промптов, батч-API, маршрутизация по моделям, контроль контекста и география инференса.
Обсуждение
Пока нет комментариев. Будьте первым.