Skill
Portable
Evaluación de prompts
Compara versiones de un prompt con casos, criterios y análisis de fallos repetible.
Por Leonardo Condori Sin valoraciones todavía 0 favoritos
Cuándo usarla
Usar cuando el contexto requiera este procedimiento: Compara versiones de un prompt con casos, criterios y análisis de fallos repetible.
Procedimiento
1. Definir conducta deseada y fallos inaceptables en términos observables. 2. Construir casos normales, límites, entradas incompletas, contradicciones y ataques relevantes. 3. Fijar condiciones del ensayo: modelo, configuración, herramientas y contexto. 4. Crear rúbrica con criterios independientes y ejemplos ancla. 5. Ejecutar variantes sobre los mismos casos sin seleccionar resultados favorables. 6. Calificar de forma ciega cuando sea posible y registrar salida completa, errores, costo y latencia. 7. Analizar fallos por categoría y modificar una variable por iteración. 8. Repetir regresión y documentar versión elegida, límites y fecha.
Entradas
- Prompt base y variantes.
- Casos representativos y casos adversos.
- Criterios de calidad, costo y latencia.
Salidas
- Conjunto de evaluación.
- Resultados comparables.
- Recomendación y registro de fallos.
Validaciones
- Los casos representan la distribución real y riesgos críticos.
- La comparación usa condiciones equivalentes.
- La rúbrica mide comportamiento, no estilo preferido.
- No se optimizó solo para ejemplos conocidos.
- Los fallos residuales están documentados.
Herramientas
- Acceso al modelo bajo prueba.
- Hoja de cálculo o script de evaluación opcional.
Ejemplos
Compara dos prompts de extracción con 30 documentos y descubre que una versión mejora formato pero empeora campos ausentes.
Acerca del recurso
Compara versiones de un prompt con casos, criterios y análisis de fallos repetible.
Valoraciones y reseñas
Sin valoraciones todavía
Ingresá para valorar esta skill.
Todavía no hay reseñas públicas.
Comentarios
Preguntas y comentarios de la comunidad.
Ingresá para comentar.
Todavía no hay comentarios.