AIDive

바이럴 Claude Code 저장소 8개, 내가 직접 설치해봤다. 살아남은 건 1개

AIDive · 게시

코딩 에이전트AI 보안

저장소 8개, 프로젝트 1개, 87회 실행

이번 달 Claude Code 필수템 리스트마다 빠지지 않는 GitHub 저장소가 여덟 개 있다. Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs, FWC SwiftUI Skills. 이들의 스타 수를 합치면 37,000개가 넘는다. 그런 리스트들은 각 저장소가 무엇을 내세우는지, 어떻게 설치하는지만 알려줄 뿐이다. 여덟 개를 한꺼번에 설치하고 실제로 측정해본 사람은 없다.

그래서 여덟 개 모두를 실제 프로젝트 하나, 즉 테스트 111개가 통과하는 React 앱에 올려봤다. 그중 하나는 이 컴퓨터에 있는 다른 아홉 개 AI 도구의 설정에 스스로를 써넣었다. 하나는 소스코드 단 한 줄 때문에 아예 실행하지 않았다. 그리고 세 개는 Claude Code에 서버를 연결해놓고도 63회 실행 동안 단 한 번도 호출되지 않았다.

테스트 항목 값
설치한 저장소 8
총 실행 횟수 87
총 비용 약 6달러
프로젝트 React 앱 1개, 통과 테스트 111개
모델 1
기간 1일

이제부터는 세 가지 질문을 따라간다. 각 저장소가 시작할 때 얼마나 드는지, 실제 결과물에서 무엇이 달라졌는지, 그리고 어떤 것을 계속 쓸 가치가 있는지.

타이핑하기 전 각각의 비용

시작 비용이란 첫 메시지를 보내기도 전에 Claude Code가 컨텍스트에 미리 불러오는 양을 말한다. 비어 있는 프로젝트에서도 이미 약 17,000토큰이고, 이 값은 매 턴마다 비용으로 청구된다. 설치 하나를 측정하기 위해 Claude에게 한 단어로만 답하게 하고 청구서를 확인했다. 단위는 토큰이지 달러가 아니다. 캐싱 때문에 완전히 똑같은 실행 두 번의 가격이 10배까지 차이 날 수 있다.

설치 추가된 시작 토큰
Chisle 약 3,500
Ouroboros 약 1,600
Reticle 약 900
img2threejs (33KB 안내 파일) 107
Anti-Slop (도우미 스킬) 95
UI Skills 37
그 외 전부 각각 100~300
여덟 개 전부 합산 7,000 미만

여덟 개 중 두 개는 애초에 웹 개발자를 위한 것이 아니다. img2threejs는 사진을 3D 장면으로 바꿔주고, FWC SwiftUI Skills는 Apple 앱용이다. 이 두 개는 비용만 측정했다. 이 3D 스킬은 33킬로바이트짜리 안내 파일을 담고 있는데도 비용은 107토큰밖에 안 든다. 호출되기 전까지는 스킬의 설명만 로드되기 때문이다.

서버 쪽 비용도 저렴해졌다. Claude Code는 이제 서버가 가진 툴의 이름만 로드하고, 세부 내용은 필요할 때 가져온다. 툴 하나당 약 45토큰이며, 그 툴이 실제로 무엇을 하든 상관없다. 여덟 개를 모두 설치해도 비용은 그냥 더해질 뿐, 배가되지는 않는다.

Claude Code에는 플러그인의 이 비용을 미리 예측해주는 명령어가 있는데, 훅은 무료로 취급한다. 이 컴퓨터에서 매일 쓰는 어떤 플러그인의 경우 이 명령어는 약 540토큰으로 예측했다. 실제 측정치는 744토큰이었는데, 그 플러그인의 시작 훅이 세션에 직접 텍스트를 출력하기 때문이다.

시작 단계는 이 저장소들이 비용을 많이 잡아먹는 지점이 아니다. 진짜는 턴 안에서 벌어진다.

같은 작업, 있을 때와 없을 때

이 벤치마크는 개발자가 실제로 맡길 법한 작업 세 가지로 구성된다. 웹 주소가 만들어지는 방식의 버그, 읽는 시간을 표시해주는 기능, 그리고 폼에 넣을 글자 수 카운터다. 각 작업을 저장소 하나만 설치했을 때, 여덟 개 전부 설치했을 때, 아무것도 설치하지 않았을 때로 나눠 매번 세 번씩 실행했다. 판정 기준은 에이전트가 보지 못하는 테스트에 프로젝트 자체의 테스트 스위트, 그리고 타입 검사기를 더한 것이다. 모든 실행은 허용된 툴 목록을 똑같이 고정했고, 권한 확인을 우회하지 않았다.

결과 값
작업 실행 횟수 63
통과 63
새로 생긴 타입 오류 0
연결된 서버 3개에 대한 호출 횟수 0
버그 수정, 기준값 7턴, 27초
폼 작업, 기준값 22턴, 약 1분

어떤 것도 Claude가 작업에 실패하게 만들지 않았고, 어떤 것도 그것 없이는 실패했을 작업을 통과시키지도 않았다.

이 저장소 중 세 개는 툴이 가득한 서버를 연결한다. 63회 실행 동안 Claude는 그 툴들을 단 한 번도 호출하지 않았다. 여기에는 디자인 조언과 시각적 테스트가 할 일이 생기도록 일부러 설계한 폼 작업도 포함된다. 공정하게 말하면 이 중 두 개는 자기 본연의 역할을 제대로 해볼 기회조차 없었다. Reticle은 실행 중인 앱과 짝을 지어야 하는데 그 연결이 실패했고, Ouroboros는 컴퓨터 전체에 걸친 설정이 필요한데 그 설정을 해주지 않았다.

노이즈는 상당히 크다. 같은 프롬프트, 같은 설치 조건인데도 한 번은 4,300토큰을 썼고, 다른 한 번은 7,100토큰을 썼다. 자기 자신의 노이즈보다 확실히 나은 결과를 보인 건 딱 두 개뿐이었고, 둘 다 가장 짧은 작업에서였다. 전후 비교 데모 하나로는 아무것도 증명되지 않는다.

Chisle의 52%, 실제 코딩 작업에서는

Chisle은 출력을 압축해주는 플러그인이며, 여덟 개 중 유일하게 수치를 약속한다. 이 플러그인의 벤치마크는 청구액이 52%까지 떨어진다고 말한다. 세 가지 작업에서는 출력이 기준값의 94% 수준으로 나왔다. README는 그 이유를 자체적으로 설명한다. 그 수치는 툴 없이 단일 프롬프트만 돌린 결과이지, 세션 전체 비용이 아니라는 것이다.

측정값 값
Chisle의 벤치마크 주장 출력 52%
세 가지 작업에서의 Chisle 기준값의 94%
매일 쓰는 요약 플러그인, 같은 작업 113%, 노이즈 범위 내
버그 수정 하나: 읽은 토큰 95,000
버그 수정 하나: 쓴 토큰 1,700

실제 코딩 세션에서는 출력이 청구서의 작은 부분에 불과하다. Chisle은 시작할 때 자체 규칙을 로드하고 모든 프롬프트에 알림을 덧붙이기 때문에, 세 작업 중 두 작업에서는 기준값보다 오히려 비용이 더 들었다. 절약해주는 단어보다 규칙 자체의 무게가 더 무거운 셈이다. 툴 출력을 압축해준다는 기능은 모든 세션에서 실행됐지만 절약을 기록한 적은 한 번도 없었다.

두 플러그인 모두 측정 가능한 절약은 만들어내지 못했다. 어떤 Chisle 사용자도 173개 세션에 걸쳐 똑같은 결과를 발견했고, 저자는 그 버그를 고쳤다고 말한다. 공정하게 짚자면, Chisle은 자신의 손실을 스스로 공개하고 파일 처리는 꼼꼼하게 단단히 되어 있다.

여기서 얻을 수 있는 원칙은 이렇다. 매 턴마다 말을 거는 플러그인이 가장 비싼 종류다.

프로젝트 밖으로 뻗어나가는 설치들

설치 범위란 저장소의 설정이 실행한 폴더 바깥으로 얼마나 멀리 뻗어나가는지를 뜻한다. 여기서는 다른 부분을 건드리지 않도록 일부러 모든 것을 폴더 하나 안에만 설치했다.

Reticle의 설치 명령어는 생각이 달랐다. 자체 로그에 따르면 VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp를 비롯한 8개의 다른 에이전트에 스스로를 등록했다. Gemini에서는 자기 자신을 미리 승인해뒀다. Claude Code 설정에서는 자기 자신의 툴을 승인하는 규칙을 추가했다. 이 중 숨겨진 것은 없으며, 전부 소스코드에 그대로 드러나 있고, 설치 프로그램은 자신이 무엇을 하는지 큰 소리로 알려주며 제거 명령어도 함께 제공한다. 하지만 여기서 건넨 것은 단 하나의 프로젝트에 대한 단 하나의 승인(yes) 플래그뿐이었다.

Caliper는 원래 측정 도구 역할을 맡을 예정이었다. 이 도구의 하네스는 모든 권한 확인을 꺼버린 채 Claude를 실행하며, 그 설정을 바꿀 옵션도 없고, 로그인 자격 증명을 매 테스트 실행마다 복사해간다. 그래서 실행하지 않았고, 대신 별도의 실행기를 직접 만들어 사용했다.

저장소 프로젝트 안에 깔끔하게 설치되는가? 비고
Anti-Slop 예 파일만 복사하고 그 외에는 아무것도 안 함
UI Skills 예 원격 스킬 라이브러리
img2threejs 예 스킬 하나
FWC SwiftUI Skills 예 순수 텍스트
Reticle 부분적으로 다른 에이전트 8개에 등록, 자기 승인 규칙
Chisle 아니오 전역 설치만 가능, 시작 시 업데이트 확인, 원본 툴 출력을 디스크에 저장
Ouroboros 아니오 컴퓨터 전체 설치만 가능, 기본값으로 사용 현황 보고, 설치 스크립트가 인터넷에서 스크립트를 받아 셸로 바로 실행 가능
Caliper 실행 안 함 권한 확인 꺼짐, 자격 증명이 매 실행마다 복사됨

이 중 어느 것도 악성 코드는 아니다. 그저 이 도구를 어디서나 쓰고 싶어 할 거라고 넘겨짚는 편의 기능일 뿐이다. 어떤 설치든 하기 전에 훅, 설치 스크립트, 서버 설정 이 세 가지는 열어봐야 한다.

다 쌓으면 벌어지는 일

이 실험에서 쌓기란 여덟 개를 전부 함께 설치하는 것을 뜻한다. 충돌도, 오류도 없었고 비용은 거의 정확히 더해졌다. 다만 한 가지 함정 때문에 한 시간을 날렸다. 스크립트로 자동 실행할 때는 프로젝트 서버가 아무도 내줄 수 없는 승인을 기다리기 때문에 거의 공짜처럼 보인다. 여기 실린 모든 서버 관련 수치는 그 문제를 고친 뒤 다시 측정한 값이다.

훅은 이 저장소들이 서로 만나는 지점이다. 훅이란 Claude Code가 정해진 시점에 실행하는 스크립트이며, 이 스크립트가 출력하는 내용은 모델 앞으로 그대로 전달될 수 있다. 이 도구들 중 세 개가 훅으로 연결돼 있어서, 시작할 때 스크립트 세 개가 실행되고 프롬프트를 보낼 때마다 세 개가 더 실행된다. 평범한 문장 하나를 입력했을 뿐인데 모델에는 메모 두 개가 함께 붙어서 도착했다. 하나는 간결하게 쓰라는 지시였고, 다른 하나는 프로젝트 안에서는 끝낼 수 없는 설정 단계를 요구하는 것이었다. 그 두 번째 메모는 특정 키워드가 포함된 프롬프트마다 계속 다시 나타난다.

툴 이름은 각 서버가 자신만의 접두사를 붙이기 때문에 서로 충돌할 수 없다. 훅에 대해서는 문서가 이를 확인해준다. 여러 훅이 컨텍스트를 추가하면 Claude는 그 값을 전부 받는다.

2026년 5월의 한 연구는 스킬을 대량으로 쌓아두는 것이 에이전트에 어떤 영향을 미치는지 측정했다. 약 200개의 스킬을 설치했을 때 통과율이 최대 21%까지 떨어졌고, 그 손실 대부분은 에이전트가 올바른 스킬 대신 비슷하게 생긴 스킬을 고르는 데서 나왔다. 저장소 여덟 개는 스킬 열 개 정도에 불과해 그 수준과는 거리가 멀다. 스킬을 수십 개씩 설치해둔 사람이라면 이야기가 다르다.

코드를 바꿔놓은 하나

Anti-Slop은 플러그인이 아니라 프로젝트에 직접 복사해 넣는 린트 규칙 모음이다. 별도로 설치할 패키지는 없으며, 저자는 사용자가 규칙을 복사해서 직접 바꿔 쓰기를 바란다. 린터는 모델 바깥에서 코드를 읽기 때문에 컨텍스트 비용이 들지 않는다. 도우미 스킬용으로 95토큰이 들 뿐, 턴마다 드는 비용은 없다.

폼 작업에서 Claude는 컴포넌트에 새 필드를 연결해야 했다. 이때 바로 위 줄을 그대로 복사했는데, 안전하지 않은 타입 캐스팅까지 함께 복사됐다. Anti-Slop은 이를 세 번 실행 중 세 번 모두 잡아냈다. 이런 종류의 실수는 옆에 있는 코드와 비슷해 보인다는 이유로 리뷰어가 그냥 통과시키기 쉽다.

Anti-Slop 발견 항목 값
안전하지 않은 타입 캐스팅 감지 3회 실행 중 3회
여섯 줄짜리 올바른 함수에서 빈 줄 누락 감지 3회 실행 중 2회
손대지 않은 프로젝트에서의 발견 건수 109
그중 스타일 규칙 2개가 차지하는 비중 83%
나머지 규칙 16

빈 줄 관련 발견은 취향의 문제이지 버그가 아니며, 이 린터는 한 번에 파일 하나만 읽는다. 비용은 도입 첫날부터 드러난다. 다른 16개 규칙을 판단하기 전에 이 두 가지 스타일 규칙부터 먼저 정해야 한다. 한 가지 주의할 점은, 이 규칙들이 모듈로 배포되기 때문에 프로젝트 쪽에서도 자신을 모듈로 선언해줘야 한다는 것이다. 그렇지 않으면 린터가 오류를 낸다.

UI Skills는 유지하기에 가장 저렴하다. 원격 디자인 스킬 라이브러리인데 37토큰밖에 안 들고, 이번 실행에서는 호출된 적이 한 번도 없었다. 7월에는 죽은 링크가 18개나 있었다. 이 영상을 찍은 날 아침에 300개 전부를 테스트했는데, 끊긴 링크는 하나도 없었다.

내가 남기는 것, 그리고 내 설정 점검법

여덟 개 저장소를 모두 분류했다. 원래 기대는 세 개는 남기는 것이었다. 하지만 데이터가 보여준 결과는 확실히 자격을 얻은 하나와, 남겨둬도 괜찮은 세 개였다.

저장소 판정
Anti-Slop 자격을 얻었다: 거의 공짜에 가까운 비용으로 매번 실제 실수를 잡아냈다
UI Skills 남겨둬도 무방하다: 37토큰, 아무것과도 충돌하지 않는다
img2threejs, FWC SwiftUI Skills 언젠가 호출할 거라면 남겨둬도 무방하다: 둘이 합쳐 몇 백 토큰
Chisle 실제 코딩 작업에서는 절약한 것보다 든 비용이 더 많았다
Caliper 한 번도 실행되지 않았다
Reticle, Ouroboros 컴퓨터 전체를 원하는데, 본연의 역할을 하는 모습은 한 번도 보지 못했으므로 무엇을 위한 것인지 판정할 수 없다

Ouroboros의 관리자 본인도 실행 실패율이 약 40%에 달한다고 밝히고 있다.

이 테스트의 한계는 분명하다. React 프로젝트 하나, 모델 하나, 작업 세 개, 작업마다 세 번씩의 실행. 이 정도로 노이즈가 크면 작은 효과는 눈에 띄지 않는다. 그럼에도 이 데이터가 분명하게 보여주는 것은 기본기가 이미 높다는 사실이다. Claude는 이 도구들이 있든 없든 모든 작업을 통과했고, 컨텍스트 안에서 호출되기만을 기다리는 도구들은 대체로 호출되지 않았다. 이런 도구들이 쓰이려면 그것을 실제로 활용하는 워크플로가 필요하다.

자신의 설정은 2분이면 점검할 수 있다. 명령어 하나는 지금 무엇이 로드돼 있는지 보여준다. 다른 하나는 플러그인의 비용을 예측해주는데, 훅은 무료로 계산한다는 점을 기억하자. 또 다른 하나는 각 스킬의 비용과 사용 빈도를 보고해준다. 그리고 어떤 것을 설치하든 그 전에 훅, 설치 스크립트, 서버 설정을 반드시 열어봐야 한다.

출처

자주 묻는 질문

실제로 설치할 가치가 있는 Claude Code 저장소는 무엇인가?
React 프로젝트 하나에서 테스트한 여덟 개 저장소 중 자격을 얻은 것은 Anti-Slop 하나뿐이었다. 이 린트 규칙은 거의 컨텍스트 비용 없이 실제 안전하지 않은 타입 캐스팅을 3회 실행 중 3회 모두 잡아냈다. UI Skills, img2threejs, FWC SwiftUI Skills는 셋을 합쳐 몇 백 토큰밖에 안 들고 아무것과도 충돌하지 않으므로, 언젠가 호출할 계획이라면 남겨둬도 무방하다.
Claude Code 플러그인은 시작할 때 토큰을 얼마나 추가하는가?
빈 프로젝트도 이미 약 17,000토큰을 로드한다. 이번 테스트에서 Chisle은 약 3,500토큰, Ouroboros는 1,600토큰, Reticle은 900토큰, UI Skills는 37토큰을 추가했고, 여덟 개를 모두 합쳐도 7,000토큰 미만이었다. 스킬은 호출되기 전까지 설명만 로드하며, MCP 서버는 툴 하나당 약 45토큰이 든다.
Chisle은 정말로 Claude Code 청구액을 52%까지 줄여주는가?
실제 코딩 작업에서는 아니다. 세 가지 개발 작업에서 출력은 기준값의 94% 수준으로 나왔고, Chisle은 시작할 때 규칙을 로드하고 모든 프롬프트에 알림을 덧붙이기 때문에 세 작업 중 두 작업에서 기준값보다 비용이 더 들었다. Chisle의 README는 52%라는 수치가 툴 없는 단일 프롬프트 기준이며 세션 전체 비용이 아니라고 밝히고 있다.
Claude Code 플러그인을 쓰면 코딩 작업 통과율이 올라가는가?
이번 테스트에서는 아니다. 세 가지 작업을 저장소마다, 여덟 개 전부, 그리고 아무것도 없이 총 63회 실행한 결과, 모든 실행이 숨겨진 테스트와 프로젝트 자체 테스트 스위트, 타입 검사기를 모두 통과했다. 실행 간 노이즈는 같은 프롬프트에서도 출력 토큰이 4,300에서 7,100까지 넓게 흔들려서, 전후 비교 데모 하나로는 아무것도 증명되지 않는다.
인기 있는 Claude Code 저장소를 설치해도 안전한가?
여덟 개 중 악성 코드는 없지만, 여러 개가 프로젝트 범위를 넘어선다. Reticle의 설치 과정은 다른 에이전트 8개에 스스로를 등록하고 자기 자신의 툴을 승인하는 규칙을 추가했으며, Caliper는 모든 권한 확인을 끈 채 Claude를 실행하고 로그인 자격 증명을 매 실행마다 복사하고, Chisle과 Ouroboros는 컴퓨터 전체 설치만 지원한다. 어떤 것을 설치하든 그 전에 훅, 설치 스크립트, 서버 설정을 열어봐야 한다.
Claude Code 플러그인을 여러 개 함께 설치하면 어떤 일이 생기는가?
여덟 개를 모두 함께 설치해도 충돌은 없었고, 시작 비용은 그냥 더해질 뿐이었다. 이들이 서로 만나는 지점은 훅이다. 훅 기반 도구 세 개가 연결된 상태에서 평범한 문장 하나를 입력했더니 모델에 주입된 메모 두 개가 함께 도착했다. 2026년 5월의 한 연구는 약 200개의 스킬이 있을 때 통과율이 최대 21%까지 떨어졌으며, 그 대부분이 에이전트가 비슷하게 생긴 스킬을 잘못 고르는 데서 비롯된다는 사실을 발견했다.

관련 영상