Tanda de repos 17-08-2026: 4 evaluaciones, 6 cherry-picks adoptados
Qué se decidió
Tanda de investigación de 4 repos externos (17-08-2026, GO de Edu el mismo día). Ninguno se adopta en bloque; se cazan 6 mecanismos concretos. Evaluación completa con veredictos por repo en la memoria reference_4repos_research_ago2026 del proyecto CreaRack-Pro.
Los repos: chenxiachan/thoughtdag (lienzo de pensamiento con LLMs) · cathrynlavery/diagram-design (diagramas editoriales para agentes, 20k★) · hamr0/liteagents (kit de agentes multi-CLI) · valera-studio-group/valera-studio-project (GitLab, harness de memoria paginada).
Lo adoptado y dónde vive
- Golden-set del Curator (de thoughtdag) — el prompt del juez Curator sale de
wiki.tsafunctions/_lib/judge-prompts.mjsconCURATOR_PROMPT_VERSION; 10 casos dorados enfunctions/_lib/curator-goldens.json, runner local pre-mergescripts/test-curator-goldens.mjs, y cron mensual en OPS (día 1, 06:30 UTC → endpointPOST /api/biblioteca/curator-goldens-run, alerta rodante con fallos, vigilado por cron-heartbeat con ventana 800 h) que caza drift del MODELO. Disciplina: cambiar el wording del prompt = bump de versión + pasar los goldens en el mismo cambio. Workspaceaea62619+91ca8e43. - Sensor de fricción sobre los JSONL de sesión (de liteagents) — fuente de evidencia nueva en
/crearack:self-harness: minar los transcripts buscando correcciones que nadie apuntó; solo una reacción observada del usuario siembra un candidato, las señales de máquina solo corroboran. claude-methodcef99c5. - Ciclo de vida post-promoción (de liteagents) — en
/crearack:self-harness: una regla que vuelve a fallar estando cargada se reformula a la 2ª recurrencia; tras 2 reformulaciones fallidas se escala a hook/check mecánico o se registra como límite aceptado. - Campo
keys:en fichas de memoria (de valera-studio) — alias de búsqueda que no están en el cuerpo; casa estructural del “añade el alias” de la regla globalbacktrack. - Campo
origin:en fichas de memoria (de valera-studio) —operator|measured|cited|inferred; recogido en la regla globalcriterio-trabajo(lo inferido sin confirmar es la memoria que más se pudre). - Importador draw.io como candidato de producto (de diagram-design) —
drawio_extract.py(MIT, stdlib) como semilla de un “importa tu diagrama de datacenter a CreaRack”; task #231 del Gestor para valorarlo con las llamadas MSP de septiembre.
El estreno del golden-set (17-08, mismo día) — hallazgo real
La primera corrida de calibración (desde OPS, contra el prompt desplegado) dio 9/10 y el caso fallado destapó un agujero latente del Curator: con snippet “(contenido no disponible)” el juez razonaba “página vacía = delete” — pero ese estado también significa fallo puntual del fetch a GitHub, así que un error de red podía hacer que el Curator borrara páginas buenas. Fix en el prompt (nunca delete con contenido no disponible → keep-draft) con bump a CURATOR_PROMPT_VERSION = 2026-08-17.2 (workspace 87a06b90); la re-corrida dio 10/10 y la alerta rodante se auto-resolvió — ciclo completo del mecanismo (examen → fallo → alerta → fix versionado → verde → auto-resolve) verificado en producción el día del estreno.
Nota de método: esta única edición del prompt se validó post-merge contra el endpoint desplegado (la clave Anthropic no existe en local); el flujo normal en adelante es el gate manual pre-merge con scripts/test-curator-goldens.mjs.
Nevera (visto y no adoptado, a propósito)
Miss-ledger de búsquedas fallidas con métrica semanal · “no silent caps” · marca [Stale] explícita en respuestas de bib_ask apoyadas en docs con drift · insignias epistémicas (DECISION/RULEOUT/PIVOT) en LOG.md · checks mecánicos del os-audit en CI · fidelity ledger de conversiones con pérdida.
Véase también
- [[decision—20260522—evaluacion-understand-anything-vs-bibliotecario]]
- [[feature—biblioteca—arcrift-sentence-trimming]]
- [[feature—biblioteca—understand-anything-s79]]