TL;DR
- DeepSeek Harness (dsh) это кодинг-агент под лицензией MIT, где модели, инструменты, песочницы, хранилище, циклы и интерфейс являются плагинами, которые меняются в конфиге. В репозитории уже больше 21,000 звезд и больше 12,000 коммитов.
- Сильнейшая идея: журнал сессии только на добавление. Сбившуюся сессию можно воспроизвести событие за событием, а не листать транскрипт.
- DeepSeek V4 Pro 0813 заявляет около 80.6% на SWE-bench Verified против 80.8% у Claude Opus 4.6. Все результаты заявлены самой компанией, независимо их пока никто не воспроизвел.
- Стартовая цена: $0.435 за миллион входных токенов и $0.87 за выходные. С 16 августа API переходит на пиковый и внепиковый тариф, и выход доходит до $3.96 в пик, что все равно примерно в четыре раза дешевле Opus 5.
- dsh это developer preview версии 0.1, и в README обещаны ломающие изменения. Тем, кто делает инструменты: ставьте на этой неделе. Тем, кто режет расходы: проверьте V4 Pro на побочном проекте по ставкам с 16 августа. Тем, кто каждый день работает в Claude Code: оставайтесь на месте.
Что говорят источники
Архитектура
Весь harness стоит на ядре Cordis, а официальная страница описывает каждую возможность как то, что можно выбрать, заменить или расширить в конфигурации, не трогая код harness s8. Это шире, чем skills и MCP-серверы в Claude Code: в Claude Code агента расширяют по краям, а в dsh можно пересобрать песочницу, хранилище сессий и сам цикл s1. В теме GitHub dsh-plugin уже есть community-плагины, в том числе плагины моделей, которые позволяют запускать harness на моделях не от DeepSeek s10.
Установка одной командой: npx @deepseek-ai/dsh web запускает локальный веб-интерфейс на порту 3080, аккаунт не нужен, а тот же код обслуживает и терминальный режим. Клонирование и сборка всего репозитория занимает четыре команды pnpm s2.
В dsh четыре режима выполнения. Standard это полноценный кодинг-агент (правка файлов, shell, поиск, планирование). Code заставляет модель писать TypeScript, который сам оркестрирует многошаговые операции, вместо цепочки вызовов инструментов по одному, что сокращает число обращений к API на длинных задачах. Minimal оставляет только bash и редактор файлов, в основном для замера голой модели. Creator нужен для создания собственных пресетов с живой инспекцией рантайма s8.
Все, что видит модель, попадает в журнал сессии только на добавление: промпты, рассуждения, вызовы инструментов, инъекции контекста. Этот журнал является источником истины для harness, поэтому любую сессию можно возобновить, форкнуть, найти по ней или воспроизвести из потока событий s1.
Модель
V4 Pro 0813 это модель mixture-of-experts с контекстным окном в 1M токенов, до 384,000 выходных токенов, вызовами инструментов и JSON-выводом s4. API DeepSeek заявляет совместимость с Anthropic API, так что инструмент, написанный под Claude, может работать с V4 Pro после смены base URL и ключа s3.
По собственным данным DeepSeek, вариант Max дает около 80.6% на SWE-bench Verified против 80.8% у Claude Opus 4.6, а также заявленные победы на Terminal Bench 2.1 и нескольких агентных бенчмарках против Opus 4.8. В индексе Artificial Analysis V4 Pro получает 53, Opus 5 получает 63, Fable 5 получает 62. По скорости V4 Pro выдает 83 токена в секунду, а Opus 5 выдает 52 s5.
Ни один из этих результатов не воспроизведен третьей стороной. Бенчмарки сначала появились в официальной группе DeepSeek в WeChat, потом в посте на Reddit, который удалили модераторы, потом в виде ASCII-таблицы на Hacker News. Официальной страницы анонса нет, открытые веса не подтверждены, хотя апрельская V4 Pro и июльская V4 Flash в итоге оказались на Hugging Face. Единственное практическое наблюдение на сегодня: три уровня рассуждения дали три радикально разных результата на одном и том же промпте с рисунком, чего не наблюдалось ни у одной другой модели s5.
Цены
На старте V4 Pro стоит $0.435 за миллион входных токенов и $0.87 за миллион выходных, а контекст в 1M тарифицируется по стандартной ставке без надбавки за длинный контекст s3. Claude Opus 5 стоит $5 на входе и $25 на выходе, Fable 5 стоит $10 и $50, Sonnet 5 стоит $2 и $10 s6. Получается, что V4 Pro примерно в 11 раз дешевле Opus 5 по входу и в 28 раз по выходу, и все равно в 4-11 раз дешевле Sonnet 5 s3.
Типичная агентная сессия из 50,000 входных и 15,000 выходных токенов стоит около $0.62 на Opus 5 и $0.035 на V4 Pro по стартовым ставкам. Скрытая статья расходов у агентов это кэш: harness на каждом ходу пересылает один и тот же контекст, так что большая часть входных токенов это повторное чтение. Попадание в кэш стоит $0.50 за миллион на Opus 5 s6 и $0.0036 на DeepSeek, то есть 138 к одному ровно там, где агент тратит больше всего s3.
С 16 августа, через три дня после запуска, API переходит на пиковую и внепиковую тарификацию. Вне пика V4 Pro подорожает до $0.66 на входе и $1.98 на выходе. В пик, между 1h и 4h и между 6h и 10h UTC, цена составит $1.32 и $3.96 s3. Пиковый выход в четыре с половиной раза выше стартовой ставки, рост на 355%. Даже по худшей ставке V4 Pro остается почти в четыре раза дешевле Opus 5 s6. Пиковые часы совпадают с китайским рабочим днем, так что cron-задачи и ночные запуски по европейскому времени можно направить на внепик, а живое программирование днем попадет на часть пиковых слотов.
Реакция
Пост на Hacker News набрал больше 990 баллов за один день s7. Bloomberg подал запуск как прямой вызов Claude Code, harness от Anthropic, привязанному к моделям Claude s9.
Вердикт
| Элемент | Оставить, попробовать или пропустить | Почему |
|---|---|---|
| Плагинная архитектура dsh | Попробовать | Песочница, хранилище и цикл заменяемы; самый интересный дизайн harness на сегодня |
| Воспроизводимый журнал сессии dsh | Попробовать | Воспроизведение по событиям лучше чтения транскрипта, когда агент сбился |
| dsh как основной инструмент | Пока пропустить | Developer preview 0.1, README обещает ломающие изменения, нет опыта в продакшене |
| V4 Pro на побочных проектах | Попробовать | Контекст 1M, совместимость с Anthropic API, $0.0036 за попадание в кэш |
| V4 Pro в продакшене | Подождать | Результаты только самозаявленные, нет страницы анонса, веса не подтверждены |
| Стартовые цены в вашей таблице | Пропустить | Истекают 16 августа; считайте по $0.66/$1.98 вне пика и $1.32/$3.96 в пик |
| Claude Code для ежедневной работы | Оставить | Проверенные результаты модели, зрелая экосистема, фиксированная подписка |
Сделайте в понедельник
- Запустите
npx @deepseek-ai/dsh web, откройте 127.0.0.1:3080 и проведите тридцать минут в режиме Standard на одноразовом репозитории. - Переключите ту же задачу на режим Code и сравните число обращений к API с режимом Standard.
- Вызовите сбой нарочно, затем воспроизведите журнал сессии до события, где все пошло не так, и сравните это с чтением транскрипта Claude Code.
- Направьте один существующий скрипт, совместимый с Anthropic, на base URL DeepSeek с ключом V4 Pro и проверьте, что вызовы инструментов и JSON-вывод работают.
- Пересчитайте смету по ставкам с 16 августа: $0.66/$1.98 вне пика, $1.32/$3.96 в пик, и отметьте, какие ваши запуски попадают в 1h-4h или 6h-10h UTC.
- Измерьте долю попаданий в кэш на одной реальной агентной сессии, прежде чем доверять соотношению кэша 138 к одному.
- Следите за темой dsh-plugin на GitHub: нужен плагин модели, который запускает вашу текущую модель внутри dsh.
- Оставьте Claude Code по умолчанию и поставьте напоминание в календарь, чтобы пересмотреть решение, когда третья сторона опубликует воспроизведение SWE-bench Verified.
Что почитать дальше
- Прочитайте quickstart и соберите dsh из исходников через pnpm, чтобы увидеть, как веб-режим и терминальный режим делят одну кодовую базу s2.
- Изучите ядро Cordis и раздел "Everything is a Plugin" перед написанием плагина, потому что система пресетов это место, где происходит перекомпоновка s8.
- Следите за темой dsh-plugin и смотрите, какие community-плагины появятся первыми: модели, песочницы или хранилище покажут, куда движется экосистема s10.
- Прочитайте цепочку WeChat, Reddit, Hacker News, через которую прошли цифры бенчмарков, прежде чем цитировать где-либо число 80.6% s5.
- Проверьте карточку OpenRouter: там потолок в 384,000 выходных токенов и набор провайдеров, если нужна V4 Pro без прямого аккаунта DeepSeek s4.
- Сравните страницу цен на кэш Claude со строкой DeepSeek про попадание в кэш; именно кэш на каждом ходу сильнее всего расходится в счетах агентов s6.
- Просмотрите тред на Hacker News: там первые авторы плагинов и первые сообщения о ломающих изменениях между preview-сборками s7.
Источники
- deepseek-ai/deepseek-harness, GitHub. Зачем читать: предупреждение из README, число звезд и коммитов и дизайн журнала сессии находятся здесь.
- DeepSeek Harness quickstart guide, DeepSeek. Зачем читать: установка одной строкой и сборка из исходников четырьмя командами.
- DeepSeek API pricing, DeepSeek. Зачем читать: стартовые ставки, сетка пика и внепика с 16 августа и заметка о совместимости с Anthropic.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. Зачем читать: лимиты контекста, вывода и возможностей в одной карточке.
- First impressions of DeepSeek V4 Pro, Simon Willison. Зачем читать: единственный аккуратный разбор того, откуда взялись цифры бенчмарков.
- Claude model pricing, Anthropic. Зачем читать: ставки Opus 5, Fable 5 и Sonnet 5, на которых основан каждый множитель в этом наборе.
- Hacker News discussion of the dsh launch, Hacker News. Зачем читать: реакции практиков и первые эксперименты с плагинами.
- DeepSeek Harness home page, DeepSeek. Зачем читать: модель плагинов, Cordis и четыре режима выполнения в описании самой DeepSeek.
- Claude Code product page, Anthropic. Зачем читать: собственная подача лидера рынка, удобно сравнивать функцию за функцией.
- GitHub topic dsh-plugin, GitHub. Зачем читать: живой список community-плагинов.
FAQ
Можно ли запустить dsh с моделью Claude?
Harness принимает модели не от DeepSeek через плагины моделей, и в теме dsh-plugin такие уже есть. Две половины запуска проверяются отдельно: dsh с вашей текущей моделью или ваш текущий harness с V4 Pro через Anthropic-совместимый API.
Реальна ли разница в цене в 28x?
На стартовых ставках да: $0.87 против $25 за миллион выходных токенов. С 16 августа разрыв сокращается примерно до 4x в пиковые часы, поэтому планируйте бюджет по новой сетке.
Почему не стоит доверять результату 80.6% на SWE-bench?
Это собственная цифра DeepSeek, появившаяся через группу в WeChat и ASCII-таблицу, без страницы анонса и без независимого воспроизведения на сегодня. Она может быть точной; за пределами DeepSeek ее никто не проверял.
Что журнал только на добавление меняет на практике?
Когда агент сбивается на вызове инструмента 42, вы воспроизводите сессию до этого события и видите, что именно было у модели в контексте, вместо того чтобы восстанавливать это по плоскому транскрипту.
AIDive