Я живу в Claude Code каждый день больше года — там проекты, задачи, переписка, даже посты. Поэтому новый Opus 4.8 для меня не строчка в новостях, а обновление инструмента, который решает много моих задач. Этот релиз заметный.
Самое интересное в релизе — не сама модель. А то, что в Claude Code она теперь тащит задачу почти без меня.
Коротко, что поменялось. Детали ниже👇
🎯 ЧЕСТНОСТЬ — ДЛЯ МЕНЯ ГЛАВНОЕ
В Anthropic приводят цифру: примерно в 4 раза реже, чем 4.7, модель пропускает собственные баги в коде. Реже срезает углы, реже пишет «готово» там, где не готово. Сама говорит «тут я не уверен» вместо уверенного вранья. В Bridgewater отметили, что она находит проблемы в анализе там, где другие модели молчали.
📊 БЕНЧМАРКИ — ПЕРВЫЙ В 5 ИЗ 6
Агентный кодинг (SWE-Bench Pro) 69.2 · работа с компьютером (OSWorld) 83.4 · рассуждение (HLE с тулзами) 57.9 · GDPval 1890 · финанализ 53.9 — везде впереди GPT-5.5 и Gemini 3.1. Честный нюанс: в терминальном кодинге (Terminal-Bench) GPT-5.5 пока чуть впереди — 78.2 против 74.6. Бывает.
🚀 DYNAMIC WORKFLOWS — ГЛАВНОЕ В CLAUDE CODE
Раньше субагентов запускал я сам: просил разбить задачу, потом проверял за ними. Теперь Claude делает это без меня — строит план, режет задачу на части, поднимает десятки–сотни параллельных агентов, ставит других агентов проверять их работу, прогоняет сборку и тесты — и так по кругу, пока не сойдётся. Может довести миграцию кодовой базы на 100 000+ строк до мержа без участия человека. Включается так: /config → Dynamic workflows, потом /effort ultracode. Осторожно: токенов уходит сильно больше обычной сессии — начинайте с небольших задач.
🦀 КЕЙС, ОТ КОТОРОГО ОТВИСЛА ЧЕЛЮСТЬ
Jarred Sumner переписал Bun с Zig на Rust за 11 дней — от первого коммита до мержа. 750 тысяч строк Rust, 99.8% тестов прошло. Один workflow выводил Rust-lifetime для каждого поля во всём коде, другой переносил файлы по одному: сотни агентов параллельно, по два ревьюера на каждый файл.
Цена приятная: обычный режим — как у 4.7 ($5 за миллион токенов на вход, $25 на выход), а fast-режим сделали втрое дешевле и в 2.5 раза быстрее. Оригинал анонса — в блоге Anthropic.
Если честно, есть тут и тревожная нотка: чем больше агент делает сам, тем меньше я делаю руками. Кажется, мне это нравится больше, чем стоило бы. И это затягивает.
Разница между ИИ, который молча выдумывает, и ИИ, который честно скажет «тут я не уверен», — это разница между инструментом и напарником.
Важно ли, чтобы ИИ признавал свои ошибки?
🔥 — это главное, что нужно от нейронки 👾 — мне важнее скорость 🤔 — не замечал разницы
Поделитесь в комментариях
⚡️ Готовим ИИшницу 📲 AI новости без шума в тг боте 📰 Еще больше новостей тут
#ИИ #ClaudeCode #Opus48
Оригинал: пост в Telegram · подписаться на «Готовим ИИшницу»