💎 Mientras muchos construyen super-sistemas con múltiples habilidades y subagentes y luego ejecutan Claude Code durante horas, yo voy en la dirección opuesta: aún más meticuloso.

Sí, Codex-5.3 y Opus-4.6 son buenos, pero todavía no lo suficientemente buenos (en mi opinión. Pero abajo entenderán por qué pienso así).

¿Cuál es mi framework?

Supongamos que comenzamos un proyecto desde cero o vamos a hacer una función súper grande.

1. Discuto la implementación largamente con GPT y Claude en paralelo, compartiendo ideas entre ellos periódicamente. Luego me quedo con Claude para que haga las especificaciones, y cada especificación se la muestro a GPT. ¡Él encuentra muchas imperfecciones! Y juntos los tres refinamos las especificaciones.

2. Luego, basándonos en las especificaciones, hacemos un archivo de plan, donde cada sección está detallada al máximo por tareas + se indica a qué especificaciones debe referirse el agente de IA. También es necesario actualizar CLAUDE.md y AGENTS.md para la función/proyecto. ¡En ellos hay que especificar que debe haber pruebas y documentación para cada módulo!

3. Luego, para mayor comodidad, Claude me crea prompts que solo hay que copiar y pegar en cada etapa y presionar iniciar.

4. Luego, en chats separados con Claude, comenzamos a trabajar con las especificaciones. 1 chat = máximo 1 sección. Cuando ya hay base, se puede paralelizar. Para cada sección, primero el agente de codificación de Claude debe hacer un plan, se lo muestro a Codex, él lo valida y, por lo general, muestra un montón de puntos débiles. La mayoría de las veces basta con 1 iteración de ajuste del plan, pero a veces 2-3. Una vez que Claude termina la implementación y da un resumen de lo que hizo, se lo muestro nuevamente a Codex, él encuentra debilidades y errores. Y luego Claude los corrige. Luego /compact y continuamos (o un nuevo chat).

4.5 Sí, no uso Codex aquí sin razón. Si se revisa al agente Claude por separado en un chat aparte, también funciona, pero peor. Y uso aquí codex-5.3-extra-high.

5. Después de cada sección, y mejor aún, más a menudo, hay que hacer otra revisión a través del agente /review. Aquí lo hago tanto con sonnet-4.6 como con Codex-5.3-high (sin extra), y encuentran diferentes debilidades. También se puede ejecutar security-review en Claude si las funciones pueden conllevar inseguridad.

6. Y así hasta que las especificaciones estén completas. Luego se puede, para mayor seguridad, repasar nuevamente con los agentes y verificar si todo se hizo como debía.

Puntos adicionales:

— Atención: aunque sea por encima, ¡pero leo lo que planearon los agentes! De lo contrario es una ruleta: cuanto más tiempo se haga así, mayor es la probabilidad de desviarse bastante de lo que uno tiene en mente. Incluso con personas se necesita una sincronización constante, qué decir de los agentes.

— Es recomendable, nuevamente, probar manualmente y ver qué se hizo realmente, no solo confiar en informes y pruebas exitosas.

— El framework anterior puede ser excesivo para un MVP que hay que hacer rápidamente en 2-3 horas. Pero si hay tiempo y tokens, es mejor hacerlo bien desde el principio, porque luego la refactorización puede ser más larga y dolorosa.

P.D. Uso 1code.dev
Los chicos tienen tanto Codex como Claude Code. Ya han refinado bastante la solución, les reporté errores como pude, porque realmente es cómodo. Más cómodo que el ingenuo Claude Code desktop. Lo único: prepárense para tener 16 GB de GPU si quieren ejecutar 4 o más chats simultáneamente.
Y además es agradable que el fundador también es de los nuestros, originario de RF.

¿Cuáles son sus frameworks o trucos?

El video de arriba lo puse para llamar la atención) Está en sintonía con la investigación de Anthropic sobre qué profesiones desaparecerán pronto)

#vibecoding

@oh_my_zen