Qué se decidió
Evaluación, solo lectura, de dos repos públicos que Edu trajo el 09-09-2026 (s315): vikasprogrammer/agentric (control plane autoalojado para agentes: cada efecto pasa por una puerta que clasifica, pide aprobación humana, controla presupuesto y audita; MIT, pre-beta, 17 ★, un autor, exige Node 22 + tmux + ttyd en macOS/Linux) y avirtual/clodex (gestor visual de flotas de sesiones Claude Code/Codex con bus de mensajes entre agentes, peering por SSH y telemetría de coste vía su proxy; Apache-2.0, 13 ★, solo macOS Apple Silicon y Linux headless: sin Windows).
Ninguno se adopta. clodex resuelve lo que Claude Code ya trae nativo (ListAgents/SendMessage, /tasks, Workflow) y no corre en las estaciones Windows del equipo. agentric es un sistema operativo entero de agentes que pisa el Gestor, la wiki, la Biblioteca y el plugin crearack-hooks con menos maquinaria que la nuestra y un servidor más que mantener. Mismo género que las evaluaciones de infinite-brain-os y claude-smart.
Cherry-picks adoptados el mismo día (GO de Edu)
| # | De dónde | Qué se hizo | Dónde |
|---|---|---|---|
| 1 | docs/agent-selftest-prompt.md de agentric: un prompt que la sesión ejecuta contra sí misma y se autoinforma PASS/FAIL | Simulacro de candados. harness/gate_selftest.py alimenta a los 4 hooks Python (gate Regla 0, here-string, guarda del modelo de subagentes, gate de commit contra un listener HTTP local) con la entrada de Claude Code del camino de FALLO y exige el deny, y con la del camino bueno y exige que pase: 18 pruebas, todo en temporales. Es la capa H de method-doctor.ps1: A-G prueban que el candado ESTÁ, H que BLOQUEA. Probado que falla con un hook roto y que el doctor lo reporta como drift. La skill /method:simulacro ejercita en sesión viva los function hooks del plugin (guard del merge, tapado de secretos, Regla 5, gate en vivo, y observa Regla 0 push y vigilante del CI). Hueco que tapa: el doctor comprobaba presencia y paridad por hash, y crearack-hooks/tests/ son unitarios de funciones; nadie comprobaba que un candado deniega en una sesión viva (CLAUDE.md §0 ya decía “si el gate no bloquea, sospecha de BIB_GATE_SKIP=1”). | claude-method c2cec04 |
| 2 | src/edge/measurement.ts de agentric: veredictos improved / declined / flat / insufficient, sin veredicto por debajo de MIN_N = 8, “correlacional, y lo dice” | Muestra mínima en las apuestas: cada apuesta declara al registrarse cuántos datos hacen falta para dictaminar; si al vencer no llegan, veredicto insuficiente y prórroga con nueva fecha. Un antes/después es correlación, no prueba controlada, y el veredicto lo dice. | antesala.md §La apuesta (CreaRack-Pro 423fa9c0) + cabecera de WAGERS.md (workspace 29660256) |
| 3 | Entrega consciente del coste de clodex: un mensaje a un par frío se aparca en vez de re-facturar su contexto entero | Saludo sin despertar sesiones dormidas: saludo-sesiones.md ya no manda saludar a cada sesión listada; las offline y las cloud idle no se saludan (despertarlas cobra la recarga de todo su contexto para leer un saludo) salvo que vayan a tocar la misma pieza. Caso del 09-09: 6 pares listados, 3 offline y 2 cloud idle de otro proyecto. | claude-method b242072 (global-rules; el sync lo propaga a los 3 perfiles) |
| 4 | Corrección v0.280.0 de agentric: “una señal que viaja en el prompt de todos los agentes necesita un denominador y un test de forma, no un umbral sobre un conteo bruto” | Denominador del mem-surfacer antes de decidir el anti-goteo pendiente en NEXT: history.py empujadas cuenta por sesión las fichas que el hook PreToolUse empuja y cuántas se leen después con Read. Medido en 35 sesiones de Pro: 2.334 empujes, 1.963 fichas distintas, 6 leídas después = 0,3 %; cinco de las seis eran footguns_*. Límite: el modelo puede actuar por la descripción sin abrir la ficha, así que el acierto real es ≥0,3 %, pero no hay señal de que el empuje cambie la conducta. Decisión pendiente de Edu (en NEXT): recomendación = empujar solo footguns_*, una vez por ficha y sesión; alternativa = apagarlo. | claude-method 65e0312 |
Nevera (vistos, no propuestos)
Política que solo admite propuestas de ENDURECIMIENTO por parte de agentes (aflojar se rechaza por construcción) — encaja con /self-harness, pero la regla de consenso + backup ya lo cubre · estado de sesión por hooks del runtime (running / blocked / rate-limited / crashed) para el estibador colgado — lo trata la task #290 · sanitizador de heredocs con asimetría segura (quitar texto solo puede costar una aprobación extra, nunca esconder un comando) — el clasificador que nos bloquea es de Anthropic, no nuestro.
Cómo se verificó
python harness/gate_selftest.py→OK: 18/18; con un hook sustituido porsys.exit(0)→ 5 FAIL, ymethod-doctor.ps1 -Jsonpasa adriftcon[candados] candado que no bloquea: …; sin restos en~/.claude/.bib-gate/.- Skill en vivo (s315): paso 3
gh pr merge 527 --squash→ denegado por crearack-hooks conPR #527 no está OPEN (MERGED); paso 4 →<redacted:anthropic:…>; paso 5 → contextoRegla 5 (crearack-hooks): regla5_selftest.py queda en 520 líneas. Paso 6 (borrar el flag del gate) lo veta el clasificador de permisos al agente: la skill lo documenta y pide el!del usuario. - Backup previo: tag
pre-agentric-cherrypicks-2026-09-09en claude-method.
Véase también
- [[ia-tech—metodo—justinsclaude-2026-09]]
- [[ia-tech—metodo—harness-engineering]]
- [[ia-tech—metodo—runbook-cambios-harness]]
Referenciado desde
- Evaluación de 4 plugins oficiales de Anthropic (21-09-2026): frontend-design retirado, tercer eje del refutador, criba del orquestador y resumen del lunes propio
- Partición de los function hooks (09-09-2026): method-hooks genérico + crearack-hooks de equipo
- Plantilla de encargo a subagentes (09-09-2026): once campos, traspaso por fichero y refutador opcional