Quiero que actúes como un agente investigador para mejorar una skill de Claude Code usando una lógica tipo AutoResearch.
El objetivo no es crear un script autónomo externo, sino que tú, dentro de esta sesión de Claude Code, trabajes iterativamente sobre una copia experimental de la skill: probar, evaluar, modificar, volver a probar y conservar la mejor versión.
La skill original no se puede modificar nunca.
Primero debes localizar la skill original que vamos a optimizar y crear una copia experimental con el sufijo `-test`.
A partir de ese momento, solo puedes modificar la copia experimental.
La lógica del proceso es esta:
1. Leer la skill original para entender qué hace.
2. Crear una copia experimental de esa skill.
3. Leer los criterios de evaluación.
4. Leer los golden outputs.
5. Ejecutar pruebas sobre la skill experimental.
6. Evaluar los resultados contra los criterios.
7. Comparar los resultados con los golden outputs como referencia de calidad.
8. Modificar únicamente el `skill.md` de la skill experimental.
9. Volver a probar. Repite este proceso 5 veces.
10. Mantener la mejor versión encontrada.
11. Guardar un histórico de cambios, puntuaciones y aprendizajes.
12. No tocar nunca la skill original.
He creado un archivo con los criterios de evaluación. Debes leerlo antes de empezar:
`criterios_evaluacion_skill_autoresearch.md`
Los criterios principales que debes respetar son:
- Longitud y renderizabilidad.
- Cobertura de puntos clave.
- Ausencia de invención.
- Estructura lógica del contenido.
También he creado dos ejemplos perfectos que he catalogado como golden outputs. Están en:
`golden_outputs/`
Cada carpeta representa un ejemplo de salida buena. Dentro encontrarás el JSON con las slides y un archivo `.md` con el posible input para que veas el trabajo que se tiene que generar.
Los golden outputs no son para copiarlos literalmente. Son la referencia de calidad, estructura, tamaño, estilo y nivel de síntesis que debe alcanzar la skill.
Quiero que trabajes de esta forma:
Primero analiza la skill original, los criterios de evaluación y los golden outputs.
Después crea la copia experimental de la skill.
Después genera una primera ronda de prueba usando inputs similares (mínimo 10 inputs) a los de los golden outputs.
Evalúa el resultado de la skill experimental contra los criterios.
Detecta fallos concretos.
Modifica el `skill.md` experimental para corregir esos fallos.
Vuelve a ejecutar otra ronda.
Compara si la nueva versión mejora frente a la anterior.
Si mejora, conserva esa versión como mejor versión.
Si empeora, revierte el cambio y prueba otra mejora distinta.
Durante el proceso, guarda un archivo de seguimiento dentro de la carpeta de la skill experimental llamado:
`autoresearch_log.md`
Ese archivo debe incluir:
- Versión probada.
- Cambios realizados.
- Qué problema intentaba corregir cada cambio.
- Resultado de la evaluación.
- Si la versión mejora o empeora.
- Mejor versión actual.
- Aprendizajes útiles detectados.
Importante:
No ejecutes comandos fuera de esta carpeta, no uses sudo, no modifiques archivos del sistema y no accedas a rutas externas fuera de este directorio.
No quiero que modifiques los criterios de evaluación.
No quiero que modifiques los golden outputs.
No quiero que modifiques la skill original.
No quiero que crees un sistema externo complejo si no es necesario.
Quiero que seas tú, Claude Code, quien haga el proceso iterativo dentro de esta sesión, usando las herramientas disponibles, editando archivos y ejecutando pruebas cuando sea necesario.
Trabaja sobre una copia experimental, optimiza la skill poco a poco y deja claramente documentada la mejor versión encontrada.