БЛОГ

Opus 4.8

2026-05-29 20:49 Кейсы

Я живу в Claude Code каждый день больше года — там проекты, задачи, переписка, даже посты. Поэтому новый Opus 4.8 для меня не строчка в новостях, а обновление инструмента, который решает много моих задач. Этот релиз заметный.

Самое интересное в релизе — не сама модель. А то, что в Claude Code она теперь тащит задачу почти без меня.

Коротко, что поменялось. Детали ниже👇

🎯 ЧЕСТНОСТЬ — ДЛЯ МЕНЯ ГЛАВНОЕ

В Anthropic приводят цифру: примерно в 4 раза реже, чем 4.7, модель пропускает собственные баги в коде. Реже срезает углы, реже пишет «готово» там, где не готово. Сама говорит «тут я не уверен» вместо уверенного вранья. В Bridgewater отметили, что она находит проблемы в анализе там, где другие модели молчали.

📊 БЕНЧМАРКИ — ПЕРВЫЙ В 5 ИЗ 6

Агентный кодинг (SWE-Bench Pro) 69.2 · работа с компьютером (OSWorld) 83.4 · рассуждение (HLE с тулзами) 57.9 · GDPval 1890 · финанализ 53.9 — везде впереди GPT-5.5 и Gemini 3.1. Честный нюанс: в терминальном кодинге (Terminal-Bench) GPT-5.5 пока чуть впереди — 78.2 против 74.6. Бывает.

🚀 DYNAMIC WORKFLOWS — ГЛАВНОЕ В CLAUDE CODE

Раньше субагентов запускал я сам: просил разбить задачу, потом проверял за ними. Теперь Claude делает это без меня — строит план, режет задачу на части, поднимает десятки–сотни параллельных агентов, ставит других агентов проверять их работу, прогоняет сборку и тесты — и так по кругу, пока не сойдётся. Может довести миграцию кодовой базы на 100 000+ строк до мержа без участия человека. Включается так: /config → Dynamic workflows, потом /effort ultracode. Осторожно: токенов уходит сильно больше обычной сессии — начинайте с небольших задач.

🦀 КЕЙС, ОТ КОТОРОГО ОТВИСЛА ЧЕЛЮСТЬ

Jarred Sumner переписал Bun с Zig на Rust за 11 дней — от первого коммита до мержа. 750 тысяч строк Rust, 99.8% тестов прошло. Один workflow выводил Rust-lifetime для каждого поля во всём коде, другой переносил файлы по одному: сотни агентов параллельно, по два ревьюера на каждый файл.

Цена приятная: обычный режим — как у 4.7 ($5 за миллион токенов на вход, $25 на выход), а fast-режим сделали втрое дешевле и в 2.5 раза быстрее. Оригинал анонса — в блоге Anthropic.

Если честно, есть тут и тревожная нотка: чем больше агент делает сам, тем меньше я делаю руками. Кажется, мне это нравится больше, чем стоило бы. И это затягивает.

Разница между ИИ, который молча выдумывает, и ИИ, который честно скажет «тут я не уверен», — это разница между инструментом и напарником.

Важно ли, чтобы ИИ признавал свои ошибки?

🔥 — это главное, что нужно от нейронки 👾 — мне важнее скорость 🤔 — не замечал разницы

Поделитесь в комментариях

⚡️ Готовим ИИшницу 📲 AI новости без шума в тг боте 📰 Еще больше новостей тут

#ИИ #ClaudeCode #Opus48