Claude Code escribió 404 líneas para un calendario
· 6 min de lectura
ponytail es un repo abierto con licencia MIT, de un desarrollador independiente, que le añade a Claude Code una regla previa: antes de escribir código, comprobar si eso ya viene incluido. En el benchmark de su creador, un calendario pasó de 404 líneas a 23, y la media de 12 funciones fue un 54 % menos de código.
Le pides un calendario a Claude Code y te escribe 404 líneas. Con una regla puesta encima, el mismo calendario sale en 23. Lo que me dejó pensando no es el ahorro. Es el motivo. El navegador ya traía ese calendario. Es un control estándar, lleva años ahí, funciona en el teléfono, respeta el idioma del usuario y lo mantiene otro. El agente no lo usó: se puso a escribirlo desde cero, porque nadie le dijo que mirara primero.
La regla cabe en una frase
El repo se llama ponytail. Licencia MIT, lo mantiene un desarrollador independiente. No lo publica Anthropic y no viene recomendado por ellos: conviene decirlo antes que nada, porque circula como si fuera oficial. Lo que hace es una sola cosa: antes de teclear, comprobar si lo que le pides ya viene incluido en el navegador, en el lenguaje o en una dependencia que el proyecto ya tiene. No es un modelo mejor. Es una pregunta puesta antes del reflejo de escribir.
Este sistema es el que enseño dentro de la comunidad MÁQUINA IA: las estaciones, los gates y el código que lo sostiene.
El número, con su letra pequeña
Su creador midió 12 funciones y publicó el archivo entero. La media: 54 % menos código. Esa palabra, media, hace todo el trabajo. Lo que el promedio esconde:
- Arriba están las tareas donde el agente se sobre-construye solo. El calendario es el caso de manual: 404 líneas contra 23.
- Abajo están las tareas cuyo código ya era mínimo. Ahí el ahorro es prácticamente cero.
- En medio, recortes de un tercio o la mitad, que es lo más frecuente.
Y hay una fila que casi nadie enseña cuando comparte este repo: buscar elementos por título salió 44 líneas antes y 44 después. Cero mejora. Está publicada, en el mismo archivo, al lado de las que recortan muchísimo.
Cómo se midió, que es lo que decide si el número vale algo
Esta es la parte que nunca se cuenta y la única que me hace confiar en un porcentaje:
- Modelo: Haiku 4.5. Fuera de ahí no hay medición que citar.
- Repeticiones: media de 4 corridas. No un disparo con suerte.
- Proyecto: un repo real, con FastAPI y React, no ejercicios sueltos.
- Comparación: el mismo agente sin la regla. Se compara contra sí mismo.
- Qué se cuenta: las líneas añadidas del git diff. Lo que luego hay que mantener.
Lo que de verdad me convenció
El primer benchmark que publicó era de un solo disparo y reportaba una cifra mucho más alta como si fuera lo normal. Alguien se lo criticó en el repo: la comparación no era justa. Podía haber discutido. Podía haber dejado el número bonito en la portada, que es lo que hace todo el mundo. En vez de eso rehízo la medición contra un baseline honesto, publicó el archivo nuevo y dejó escrito que su cifra anterior era el techo de una tarea concreta, no el promedio. Bajó su propio número en público. En un sector donde todos redondean hacia arriba, eso vale más que cualquier gráfica.
Lo que me llevo, y no es sobre código
Un dato sin metodología es marketing. Modelo, repeticiones, contra qué se compara: si no está, no es un dato, es una frase bonita. El promedio es más honesto que el mejor caso. Cuando alguien te enseña su techo como si fuera su media, no te está informando: te está vendiendo. Y corregirse en público a la baja sigue siendo la señal de credibilidad más barata que existe. Casi nadie la usa. La próxima vez que veas un porcentaje espectacular sobre IA, no preguntes cuánto. Pregunta cómo lo midió, y pide la fila donde no funcionó.
Preguntas frecuentes
- ¿ponytail es de Anthropic?
- No. ponytail es un repo abierto con licencia MIT que mantiene un desarrollador independiente: no lo publica Anthropic ni viene recomendado por ellos. Conviene decirlo porque circula como si fuera una pieza oficial de Claude Code, y no lo es. Lo que sí es cierto es que funciona dentro de Claude Code, y que el benchmark que se cita lo corrió su propio creador, no Anthropic ni un tercero independiente.
- ¿El 54 % es lo que voy a ahorrar yo?
- No necesariamente. Es la media de las 12 funciones que midió su creador con Haiku 4.5. En tareas donde el agente se sobre-construye recorta mucho más; donde el código ya era mínimo, el ahorro es casi cero. Una de las 12 salió igual: 44 líneas antes y 44 después.
- ¿Funciona con otros modelos o con ChatGPT?
- La medición publicada es únicamente con Haiku 4.5 dentro de Claude Code, sobre un repo real con FastAPI y React. Fuera de ahí no hay ningún número que citar: ni para otros modelos de Claude, ni para ChatGPT, ni para cualquier otro asistente. Que la regla suene razonable en general no significa que su efecto esté medido en otro sitio, y presentarlo así sería inventarse un dato.
- ¿Menos líneas significa mejor código?
- No automáticamente. Lo que se mide es cuánto escribe de más el agente cuando la solución ya existía, no la calidad de lo que escribe.