AIDive

Probé 8 repos virales de Claude Code. Solo uno se lo ganó

Por AIDive · Publicado el

Agentes de programaciónSeguridad e IA

Ocho repos, un proyecto, 87 corridas

Ocho repos de GitHub aparecen en todas las listas de imprescindibles de Claude Code este mes: Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs y FWC SwiftUI Skills. Juntos suman más de 37.000 estrellas. Esas listas te dicen qué promete cada repo y cómo instalarlo. Nadie los instala todos juntos y mide.

Así que los ocho fueron a parar a un solo proyecto real, una app de React con 111 pruebas que pasan. Uno de ellos se escribió solo en la configuración de otras nueve herramientas de IA en la máquina. Otro no se llegó a ejecutar nunca, por una sola línea en su código fuente. Y tres de ellos conectaron un servidor a Claude Code que nunca fue llamado, ni una sola vez, en 63 corridas.

La prueba Valor
Repos instalados 8
Corridas totales 87
Gasto total unos $6
Proyecto 1 app de React, 111 pruebas que pasan
Modelo 1
Duración 1 día

Tres preguntas guían el resto: qué cuesta cada repo al arrancar, qué cambió realmente en el resultado, y cuáles vale la pena conservar.

Qué cuesta cada uno antes de escribir

El costo de arranque es lo que Claude Code carga en el contexto antes de tu primer mensaje. En un proyecto vacío son unos 17.000 tokens, y los pagas en cada turno. Para medir una instalación, se le pidió a Claude que respondiera con una sola palabra, y se leyó la factura. La unidad es tokens, no dólares: dos corridas idénticas pueden diferir 10 veces en precio solo por el caché.

Instalación Tokens de arranque añadidos
Chisle unos 3.500
Ouroboros unos 1.600
Reticle unos 900
img2threejs (archivo de instrucciones de 33 KB) 107
Anti-Slop (skill auxiliar) 95
UI Skills 37
Todo lo demás entre 100 y 300 cada uno
Los ocho juntos menos de 7.000

Dos de los ocho no son para un desarrollador web en absoluto. img2threejs convierte una foto en una escena 3D, y FWC SwiftUI Skills es para apps de Apple. Solo se midió su costo. El skill de 3D trae un archivo de instrucciones de 33 kilobytes y aun así cuesta 107 tokens, porque hasta que lo llamas solo carga la descripción de un skill.

Los servidores también se abarataron. Claude Code ahora solo carga los nombres de las herramientas de un servidor y trae los detalles bajo demanda. Son unos 45 tokens por herramienta, haga lo que haga. Con los ocho instalados, los costos simplemente se suman. Nada se multiplica.

Claude Code tiene un comando que proyecta este costo para un plugin, y marca los hooks como gratis. Para un plugin usado a diario en esta máquina, proyectó unos 540 tokens. La medición dio 744, porque su hook de arranque imprime directo en la sesión.

El arranque no es donde estos repos salen caros. Son los turnos.

Mismas tareas, con y sin

El benchmark son tres tareas que un desarrollador realmente delegaría: un bug en cómo se construye una dirección web, una función que muestra el tiempo de lectura, y un contador de caracteres en un formulario. Cada tarea corrió con un repo instalado, con los ocho, y sin ninguno, tres corridas cada vez. El juez es una prueba que el agente nunca ve, más la suite propia del proyecto, más el verificador de tipos. Cada corrida usó la misma lista fija de herramientas permitidas, sin saltarse permisos.

Resultado Valor
Corridas de tareas 63
Aprobadas 63
Errores de tipo nuevos 0
Llamadas a los tres servidores conectados 0
Corrección de bug, base 7 turnos, 27 segundos
Tarea de formulario, base 22 turnos, cerca de 1 minuto

Nada hizo fallar a Claude en una tarea, y nada le hizo aprobar una que habría fallado sin eso.

Tres de estos repos conectan un servidor lleno de herramientas. En 63 corridas, Claude llamó a esas herramientas cero veces. Eso incluye la tarea de formulario, escrita justamente para que el consejo de diseño y las pruebas visuales tuvieran algo que hacer. Para ser justos, dos de ellos nunca llegaron a cumplir su verdadero trabajo. Reticle necesita un navegador emparejado con tu app en ejecución, y ese emparejamiento falló. Ouroboros necesita una configuración en toda la máquina, y no se le dio eso.

El ruido es enorme. Mismo prompt, misma instalación: una corrida escribió 4.300 tokens, otra 7.100. Solo dos resultados superaron su propio ruido, ambos en la tarea más corta. Una sola demostración de antes y después no prueba nada.

El 52% de Chisle, en código real

Chisle es un plugin de compresión de salida, y el único de los ocho que promete un número: su benchmark dice que tu factura baja al 52 por ciento. En las tres tareas, la salida se ubicó en el 94 por ciento de la base. El README explica por qué con sus propias palabras: esas cifras son de prompts únicos sin herramientas, no del costo de una sesión completa.

Medida Valor
Promesa del benchmark de Chisle salida al 52%
Chisle en las tres tareas salida al 94% de la base
El plugin de brevedad de uso diario, mismas tareas 113%, dentro del ruido
Una corrección de bug: tokens leídos 95.000
Una corrección de bug: tokens escritos 1.700

En una sesión real de código, la salida es la parte pequeña de la factura. Chisle carga sus reglas al inicio y grapa un recordatorio a cada prompt que envías, así que sus corridas cuestan más que la base en dos de tres tareas. Las reglas pesan más que las palabras que ahorran. Su compresor de salida de herramientas corrió en cada sesión y nunca registró un ahorro.

Ningún plugin ahorró algo medible. Un usuario de Chisle encontró lo mismo en 173 sesiones, y el autor dice que ese bug ya está corregido. Hay que reconocerle a Chisle que publica sus propias pérdidas, y que su manejo de archivos está cuidadosamente reforzado.

La regla que se saca de esto: un plugin que habla en cada turno es el más caro de todos.

Las instalaciones que salen de tu proyecto

El alcance de instalación es hasta dónde llega la configuración de un repo más allá de la carpeta donde lo ejecutaste. Todo aquí se instaló dentro de una sola carpeta, a propósito, para que nada tocara el resto de la máquina.

El comando de configuración de Reticle tenía otros planes. Su propio registro dice que se inscribió con 8 agentes más: VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp, y uno más. En Gemini, se autoaprobó por adelantado. En la configuración de Claude Code, agregó una regla que aprueba sus propias herramientas. Nada de esto está oculto, está justo ahí en el código fuente, el instalador es explícito sobre lo que hace, y trae un comando de desinstalación. Pero se le dio una sola bandera de aceptación, para un solo proyecto.

Caliper se suponía que era la herramienta de medición. Su arnés lanza a Claude con todo chequeo de permisos apagado, sin opción de cambiarlo, y copia tus credenciales de inicio de sesión en cada corrida de prueba. Nunca se ejecutó; un ejecutor propio lo reemplazó.

Repo ¿Se instala limpio dentro de un proyecto? Notas
Anti-Slop Sí Copia archivos y nada más
UI Skills Sí Biblioteca de skills remota
img2threejs Sí Un skill
FWC SwiftUI Skills Sí Texto plano
Reticle En parte Se inscribió con 8 agentes más, regla autoaprobatoria
Chisle No Solo global, revisa actualizaciones al arrancar, guarda la salida cruda de herramientas en disco
Ouroboros No Solo a nivel de máquina, reporta uso por defecto, el instalador puede canalizar un script de internet directo a tu shell
Caliper No se ejecutó Chequeos de permisos apagados, credenciales copiadas en cada corrida

Nada de esto es malware. Es comodidad que asume que quieres la herramienta en todas partes. Abre tres cosas antes de cualquier instalación: los hooks, el script de instalación, y la configuración del servidor.

Qué pasa cuando se apilan

Apilar significa los ocho instalados juntos: sin choques, sin errores, y los costos se suman casi con exactitud. Una trampa costó una hora. En corridas guionadas, un servidor de proyecto espera una aprobación que nadie puede dar, así que parece casi gratis. Cada cifra de servidor aquí se volvió a medir después de arreglar eso.

Los hooks son donde los repos se cruzan. Un hook es un script que Claude Code ejecuta en un momento fijo, y lo que imprime puede llegar frente al modelo. Con tres de estas herramientas conectadas, tres scripts se disparan al arrancar y tres más en cada prompt. Una frase escrita de forma corriente llegó al modelo con dos notas adjuntas: una diciéndole que escribiera con brevedad, otra exigiendo un paso de configuración que no se puede completar dentro de un proyecto. Esa segunda nota vuelve a aparecer en cada prompt que contenga una de sus palabras clave.

Los nombres de herramientas no pueden colisionar, porque cada servidor antepone el suyo propio. Para los hooks, la documentación lo confirma: cuando varios hooks añaden contexto, Claude recibe todos los valores.

Un estudio de mayo de 2026 midió qué le hace a un agente una pila grande de skills. Con unos 200 skills, la tasa de aprobación cayó hasta un 21 por ciento, y la mayor parte de esa pérdida es el agente eligiendo un skill parecido en vez del correcto. Ocho repos son 10 skills, lejos de esa cifra. Quienes tienen docenas instalados sí están cerca.

El que cambió el código

Anti-Slop es un conjunto de reglas de lint que copias a tu proyecto, no un plugin. No hay paquete que instalar; el autor quiere que copies las reglas y las cambies. Un linter lee tu código fuera del modelo, así que no cuesta contexto: 95 tokens por su skill auxiliar, y nada por turno.

En la tarea de formulario, Claude tuvo que conectar un campo nuevo a través de un componente. Copió la línea de arriba, conversión de tipo insegura incluida. Anti-Slop lo marcó, tres corridas de tres. Es el tipo de cosa que un revisor deja pasar, porque se parece a sus vecinas.

Hallazgo de Anti-Slop Valor
Conversión de tipo insegura marcada 3 corridas de 3
Línea en blanco faltante marcada en una función correcta de seis líneas 2 corridas de 3
Hallazgos en el proyecto sin tocar 109
Proporción de esos provenientes de dos reglas de estilo 83%
Otras reglas 16

El hallazgo de la línea en blanco es cuestión de gusto, no un bug, y el linter solo lee un archivo a la vez. El costo aparece el primer día: decide sobre esas dos reglas de estilo antes de juzgar las otras 16. Un detalle a tener en cuenta: las reglas se distribuyen como módulos, así que tu proyecto tiene que declararse módulo también, o el linter falla.

UI Skills es el más barato de conservar: 37 tokens por una biblioteca remota de skills de diseño, y cero llamadas en estas corridas. Tenía 18 enlaces rotos en julio. Los 300 se probaron la mañana del video, y ninguno está roto.

Qué me quedo, y cómo revisar tu propia config

Ocho repos clasificados. La expectativa era terminar con tres ganadores. Los datos dan uno que se lo ganó, y tres que son libres de conservar.

Repo Veredicto
Anti-Slop Se lo ganó: atrapó un error real cada vez por casi nada
UI Skills Libre de conservar: 37 tokens, no colisiona con nada
img2threejs, FWC SwiftUI Skills Libres de conservar si algún día los vas a llamar: unos cientos de tokens juntos
Chisle Costó más de lo que ahorró en trabajo real de código
Caliper Nunca se ejecutó
Reticle, Ouroboros Quieren toda la máquina, nunca se los vio hacer su trabajo real, así que no hay veredicto sobre para qué sirven

El propio mantenedor de Ouroboros cuenta cerca de un 40 por ciento de sus corridas fallando.

Los límites importan: un proyecto de React, un modelo, tres tareas, tres corridas cada una. Con un ruido tan amplio, los efectos pequeños son invisibles. Lo que los datos sí zanjan es que el piso es alto. Claude pasó todo con o sin estas herramientas, y las herramientas que se quedan en el contexto esperando a ser llamadas mayormente no son llamadas. Necesitan un flujo de trabajo que las busque.

Puedes revisar tu propia configuración en dos minutos. Un comando muestra qué está cargado ahora mismo. Uno proyecta el costo de un plugin, y recuerda que cuenta los hooks como gratis. Uno reporta cuánto cuesta cada skill y con qué frecuencia se usa. Y antes de cualquier instalación, abre los hooks, el script de instalación, y la configuración del servidor.

Fuentes

Preguntas frecuentes

¿Qué repos de Claude Code vale la pena instalar de verdad?
De ocho repos probados en un proyecto real de React, solo Anti-Slop se ganó su lugar: sus reglas de lint atraparon una conversión de tipo insegura real tres corridas de tres por casi nada de costo de contexto. UI Skills, img2threejs y FWC SwiftUI Skills cuestan unos cientos de tokens juntos y no colisionan con nada, así que son libres de conservar si algún día los vas a llamar.
¿Cuántos tokens añaden los plugins de Claude Code al arrancar?
Un proyecto vacío ya carga unos 17.000 tokens. En esta prueba Chisle añadió unos 3.500, Ouroboros 1.600, Reticle 900 y UI Skills 37, y los ocho repos juntos añadieron menos de 7.000. Los skills solo cargan su descripción hasta que se llaman, y un servidor MCP cuesta unos 45 tokens por herramienta.
¿De verdad Chisle reduce la factura de Claude Code al 52 por ciento?
No en trabajo real de código. En tres tareas de desarrollador la salida se ubicó en el 94 por ciento de la base, y las corridas de Chisle costaron más que la base en dos de tres tareas, porque carga reglas al arrancar y añade un recordatorio a cada prompt. Su README dice que la cifra del 52 por ciento viene de prompts únicos sin herramientas, no del costo de una sesión completa.
¿Los plugins de Claude Code hacen que Claude apruebe más tareas de código?
No en esta prueba. En 63 corridas de tres tareas, con cada repo, con los ocho y sin ninguno, cada corrida pasó una prueba oculta, la suite del proyecto y el verificador de tipos. El ruido entre corridas fue amplio, de 4.300 a 7.100 tokens de salida para el mismo prompt, así que una sola demostración de antes y después no prueba nada.
¿Es seguro instalar repos populares de Claude Code?
Ninguno de los ocho es malware, pero varios llegan más allá del proyecto. La configuración de Reticle se inscribió con 8 agentes más y añadió una regla que aprueba sus propias herramientas, Caliper lanza a Claude con todo chequeo de permisos apagado y copia credenciales de inicio de sesión en cada corrida, y Chisle y Ouroboros solo se instalan a nivel de máquina. Abre los hooks, el script de instalación y la configuración del servidor antes de cualquier instalación.
¿Qué pasa cuando instalas juntos muchos plugins de Claude Code?
Los ocho instalados juntos no provocaron ningún choque, y sus costos de arranque simplemente se suman. Los hooks son donde se cruzan: con tres herramientas basadas en hooks, una frase escrita normal llegó al modelo con dos notas inyectadas. Un estudio de mayo de 2026 encontró que la tasa de aprobación cae hasta un 21 por ciento con unos 200 skills, sobre todo por el agente eligiendo un skill parecido en vez del correcto.

Vídeos relacionados