TL;DR
- DeepSeek Harness(dsh)는 MIT 라이선스 코딩 에이전트로, 모델, 도구, 샌드박스, 스토리지, 루프, UI가 전부 설정에서 바꿔 끼울 수 있는 플러그인입니다. 저장소는 이미 별 21,000개 이상, 커밋 12,000개 이상을 기록했습니다.
- 가장 강력한 아이디어는 append-only 세션 로그입니다. 에이전트가 엇나간 세션을 대화록 스크롤 대신 이벤트 단위로 재생할 수 있습니다.
- DeepSeek V4 Pro 0813은 SWE-bench Verified에서 약 80.6%를 주장하고, Claude Opus 4.6은 80.8%입니다. 모든 점수는 자체 보고이며, 독립적으로 재현한 곳은 아직 없습니다.
- 출시 가격은 입력 100만 토큰당 $0.435, 출력 $0.87입니다. 8월 16일부터 API는 피크/비피크 과금으로 바뀌고 피크 시 출력은 최대 $3.96까지 오르지만, 그래도 Opus 5보다 대략 4배 저렴합니다.
- dsh는 README가 호환성 깨짐을 예고하는 0.1 개발자 프리뷰입니다. 도구를 만드는 사람은 이번 주에 설치해 보고, 비용을 줄이고 싶은 사람은 8월 16일 요금 기준으로 사이드 프로젝트에서 V4 Pro를 테스트하고, Claude Code를 매일 쓰는 사람은 그대로 쓰는 편이 낫습니다.
출처가 말하는 것
아키텍처
하니스 전체는 Cordis라는 커널 위에 올라가 있고, 공식 페이지는 모든 기능을 하니스 코드를 건드리지 않고 설정에서 선택, 교체, 확장할 수 있다고 설명합니다 s8. 이는 Claude Code의 skills나 MCP 서버보다 범위가 넓습니다. Claude Code에서는 에이전트의 가장자리를 확장하지만, dsh에서는 샌드박스, 세션 스토리지, 루프 자체까지 다시 구성할 수 있습니다 s1. GitHub 토픽 dsh-plugin에는 이미 커뮤니티 플러그인이 올라와 있고, DeepSeek 이외의 모델로 하니스를 돌리는 모델 플러그인도 있습니다 s10.
설치는 명령 한 줄입니다. npx @deepseek-ai/dsh web을 실행하면 계정 없이 포트 3080에서 로컬 웹 UI가 뜨고, 같은 코드베이스가 터미널 모드도 제공합니다. 전체 저장소를 클론해서 빌드하는 데는 pnpm 명령 네 개면 됩니다 s2.
dsh에는 실행 모드가 네 가지 있습니다. Standard는 완전한 코딩 에이전트(파일 편집, 셸, 검색, 플래닝)입니다. Code는 모델이 도구 호출을 하나씩 이어 붙이는 대신 다단계 작업을 조율하는 TypeScript를 직접 작성하게 해서, 긴 작업의 API 왕복을 줄여 줍니다. Minimal은 에이전트를 bash와 파일 에디터만 남기고 벗겨 낸 모드로, 주로 모델 자체를 벤치마크하는 용도입니다. Creator는 런타임을 실시간으로 들여다보면서 나만의 프리셋을 만드는 모드입니다 s8.
모델이 보는 모든 것(프롬프트, 추론, 도구 호출, 컨텍스트 주입)은 append-only 세션 로그에 기록됩니다. 이 로그가 하니스의 단일 진실 공급원이어서, 어떤 세션이든 이벤트 스트림에서 재개, 포크, 검색, 재생할 수 있습니다 s1.
모델
V4 Pro 0813은 컨텍스트 윈도우 100만 토큰, 최대 출력 384,000 토큰, 도구 호출과 JSON 출력을 지원하는 mixture-of-experts 모델입니다 s4. DeepSeek API는 Anthropic API 호환을 내세우므로, Claude용으로 만든 도구도 base URL과 키만 바꾸면 V4 Pro를 대상으로 쓸 수 있습니다 s3.
DeepSeek 자체 수치로는 Max 변형이 SWE-bench Verified에서 약 80.6%이고 Claude Opus 4.6은 80.8%입니다. Terminal Bench 2.1과 여러 에이전트 벤치마크에서는 Opus 4.8을 이겼다고 주장합니다. Artificial Analysis 지수에서 V4 Pro는 53, Opus 5는 63, Fable 5는 62입니다. 속도는 V4 Pro가 초당 83 토큰, Opus 5가 52 토큰을 출력합니다 s5.
이 점수 중 제3자가 재현한 것은 없습니다. 벤치마크는 먼저 DeepSeek 공식 WeChat 그룹에서 돌았고, 이어 운영진이 삭제한 Reddit 글, 그다음 Hacker News의 ASCII 표로 퍼졌습니다. 공식 발표 페이지는 없고 오픈 웨이트도 확인되지 않았지만, 4월의 V4 Pro와 7월의 V4 Flash는 둘 다 결국 Hugging Face에 올라왔습니다. 지금까지 나온 유일한 직접 사용 관찰은, 같은 그림 프롬프트에서 추론 수준 세 가지가 완전히 다른 결과 세 가지를 냈다는 것입니다. 다른 모델에서는 본 적 없는 현상입니다 s5.
가격
출시 시점의 V4 Pro는 입력 100만 토큰당 $0.435, 출력 100만 토큰당 $0.87이며, 100만 컨텍스트도 장문 할증 없이 표준 요율로 과금됩니다 s3. Claude Opus 5는 입력 $5, 출력 $25, Fable 5는 $10과 $50, Sonnet 5는 $2와 $10입니다 s6. 따라서 V4 Pro는 Opus 5보다 입력은 약 11배, 출력은 28배 저렴하고, Sonnet 5보다도 4~11배 저렴합니다 s3.
입력 50,000 토큰, 출력 15,000 토큰인 전형적인 에이전트 세션은 출시 요율로 Opus 5에서 약 $0.62, V4 Pro에서 약 $0.035입니다. 에이전트에서 숨은 항목은 캐시입니다. 하니스는 매 턴마다 같은 컨텍스트를 다시 보내므로 입력 토큰 대부분이 재읽기입니다. 캐시 히트는 Opus 5에서 100만 토큰당 $0.50 s6, DeepSeek에서는 $0.0036이어서, 에이전트가 가장 많이 쓰는 바로 그 지점에서 138 대 1의 비율이 납니다 s3.
출시 사흘 뒤인 8월 16일부터 API는 피크/비피크 과금으로 바뀝니다. 비피크에서 V4 Pro는 입력 $0.66, 출력 $1.98로 오릅니다. 피크(UTC 1시4시, 6시10시)에는 $1.32와 $3.96입니다 s3. 피크 출력은 출시일 요율의 4.5배, 355% 인상입니다. 최악의 요율에서도 V4 Pro는 Opus 5보다 거의 4배 저렴합니다 s6. 피크 시간대는 중국의 근무 시간과 겹치므로, 크론 작업이나 유럽의 야간 실행은 비피크로 맞출 수 있지만, 오후에 실시간으로 코딩하면 피크 구간에 걸리는 경우가 있습니다.
반응
Hacker News 게시물은 하루 만에 990포인트를 넘었습니다 s7. Bloomberg는 이번 출시를 Claude 모델에 묶인 Anthropic의 하니스, Claude Code에 대한 정면 도전으로 보도했습니다 s9.
평가
| 항목 | 유지, 시도, 건너뛰기 | 이유 |
|---|---|---|
| dsh 플러그인 아키텍처 | 시도 | 샌드박스, 스토리지, 루프를 전부 교체할 수 있음. 현재 가장 흥미로운 하니스 설계 |
| dsh 재생 가능한 세션 로그 | 시도 | 에이전트가 엇나갔을 때 대화록을 읽는 것보다 이벤트 단위 재생이 낫다 |
| dsh를 매일 쓰는 도구로 | 당분간 건너뛰기 | 0.1 개발자 프리뷰, README가 호환성 깨짐을 예고, 프로덕션 실적 없음 |
| 사이드 프로젝트에서 V4 Pro | 시도 | 100만 컨텍스트, Anthropic API 호환, 캐시 히트 $0.0036 |
| 프로덕션에서 V4 Pro | 대기 | 점수는 자체 보고뿐, 발표 페이지 없음, 웨이트 미확인 |
| 스프레드시트에 넣은 출시 가격 | 건너뛰기 | 8월 16일 만료. 비피크 $0.66/$1.98, 피크 $1.32/$3.96으로 계산할 것 |
| 매일 쓰는 작업에 Claude Code | 유지 | 검증된 모델 점수, 성숙한 생태계, 정액 구독 |
월요일에 할 일
-
npx @deepseek-ai/dsh web을 실행하고 127.0.0.1:3080을 연 뒤, 버려도 되는 저장소에서 Standard 모드로 30분 써 보기. - 같은 작업을 Code 모드로 바꿔서 Standard 모드와 API 왕복 횟수를 비교하기.
- 일부러 실패시킨 뒤 세션 로그를 문제가 생긴 이벤트까지 재생하고, Claude Code 대화록을 읽는 것과 비교하기.
- Anthropic 호환 스크립트 하나를 V4 Pro 키로 DeepSeek base URL에 연결하고, 도구 호출과 JSON 출력이 여전히 동작하는지 확인하기.
- 8월 16일 요율로 비용 추정을 다시 만들기: 비피크 $0.66/$1.98, 피크 $1.32/$3.96. 내 실행 중 UTC 1시
4시 또는 6시10시에 걸리는 것을 표시하기. - 138 대 1이라는 캐시 비율을 믿기 전에, 실제 에이전트 세션 하나에서 캐시 히트 비중을 측정하기.
- 지금 쓰는 모델을 dsh 안에서 돌려 주는 모델 플러그인이 나오는지 dsh-plugin GitHub 토픽을 지켜보기.
- Claude Code를 기본으로 유지하고, 제3자가 SWE-bench Verified 재현 결과를 공개하면 다시 평가하도록 캘린더에 알림 걸기.
더 알아보기
- 퀵스타트를 읽고 pnpm으로 dsh를 소스에서 빌드해서, 웹 모드와 터미널 모드가 어떻게 하나의 코드베이스를 공유하는지 확인하세요 s2.
- 플러그인을 쓰기 전에 Cordis 커널과 "Everything is a Plugin" 섹션을 살펴보세요. 재구성이 일어나는 곳이 프리셋 시스템입니다 s8.
- dsh-plugin 토픽을 따라가며 어떤 커뮤니티 플러그인이 먼저 나오는지 보세요. 모델, 샌드박스, 스토리지 중 무엇이 먼저인지가 생태계의 방향을 말해 줍니다 s10.
- 80.6%라는 수치를 어디에든 인용하기 전에, 벤치마크 숫자가 WeChat에서 Reddit, Hacker News로 건너온 경로를 읽어 보세요 s5.
- DeepSeek 계정 없이 V4 Pro를 쓰고 싶다면 OpenRouter 목록에서 출력 384,000 토큰 상한과 제공자 구성을 확인하세요 s4.
- Claude 캐시 가격 페이지와 DeepSeek의 캐시 히트 항목을 비교해 보세요. 에이전트 청구액이 가장 크게 갈리는 곳이 턴마다의 캐시입니다 s6.
- Hacker News 스레드에서 초기 플러그인 작성자와 프리뷰 빌드 사이의 호환성 깨짐 첫 보고를 찾아보세요 s7.
출처
- deepseek-ai/deepseek-harness, GitHub. 읽어야 하는 이유: README 경고, 별과 커밋 수, 세션 로그 설계가 여기 있습니다.
- DeepSeek Harness quickstart guide, DeepSeek. 읽어야 하는 이유: 한 줄 설치와 명령 네 개짜리 소스 빌드.
- DeepSeek API pricing, DeepSeek. 읽어야 하는 이유: 출시 요율, 8월 16일 피크/비피크 요금표, Anthropic 호환 안내.
- DeepSeek V4 Pro 0813 on OpenRouter, OpenRouter. 읽어야 하는 이유: 컨텍스트, 출력, 기능 한도가 카드 한 장에 있습니다.
- First impressions of DeepSeek V4 Pro, Simon Willison. 읽어야 하는 이유: 벤치마크 수치가 어디서 왔는지를 꼼꼼히 짚은 유일한 글입니다.
- Claude model pricing, Anthropic. 읽어야 하는 이유: 이 팩의 모든 배수 계산 뒤에 있는 Opus 5, Fable 5, Sonnet 5 요율.
- Hacker News discussion of the dsh launch, Hacker News. 읽어야 하는 이유: 실무자 반응과 첫 플러그인 실험.
- DeepSeek Harness home page, DeepSeek. 읽어야 하는 이유: DeepSeek가 직접 설명하는 플러그인 모델, Cordis, 네 가지 실행 모드.
- Claude Code product page, Anthropic. 읽어야 하는 이유: 기존 강자의 자체 포지셔닝으로, 기능별 비교에 유용합니다.
- GitHub topic dsh-plugin, GitHub. 읽어야 하는 이유: 커뮤니티 플러그인의 실시간 목록.
FAQ
Claude 모델로 dsh를 돌릴 수 있나요?
하니스는 모델 플러그인을 통해 DeepSeek 이외의 모델도 받아들이며, dsh-plugin 토픽에는 이미 몇 가지가 올라와 있습니다. 이번 출시는 두 가지로 나눠 테스트할 수 있습니다. 지금 쓰는 모델을 dsh에서 돌려 보거나, 지금 쓰는 하니스에서 Anthropic 호환 API로 V4 Pro를 써 보는 것입니다.
28배 가격 차이는 진짜인가요?
출시 요율 기준으로는 그렇습니다. 출력 100만 토큰당 $0.87 대 $25입니다. 8월 16일부터는 피크 시간대에 격차가 대략 4배로 줄어드니, 예산은 이후 요금표로 잡으세요.
80.6% SWE-bench 점수를 왜 믿으면 안 되나요?
DeepSeek 자체 수치이고, WeChat 그룹과 ASCII 표를 거쳐 나왔으며, 발표 페이지도 없고 지금까지 독립 재현도 없습니다. 정확할 수도 있지만, DeepSeek 밖에서 확인한 사람은 아직 없습니다.
append-only 로그는 실제로 무엇을 바꾸나요?
에이전트가 도구 호출 42번에서 엇나갔다면, 세션을 그 이벤트까지 재생해서 모델이 컨텍스트에 무엇을 갖고 있었는지 정확히 볼 수 있습니다. 평평한 대화록에서 상황을 재구성할 필요가 없습니다.
AIDive