Recientemente analizamos la arquitectura del agente MemPalace, que prometía revolucionar el juego en RAG, obtenía métricas impresionantes y presumía de un innovador "Palacio de la Memoria" de una actriz de Hollywood.

Bueno, revisores independientes y la comunidad han destapado el código fuente. Spoiler: los milagros no existen, y el marketing de código abierto ha mutado definitivamente en charlatanería 🤡

Así es como se hacen ahora los proyectos AI "estrella".

🕵️‍♂️ Drama entre bastidores
Como se descubrió en X, el coautor del proyecto Ben Sigman es un fundador cripto cuyos repositorios consisten en un 80% de scripts de Bitcoin. El código de MemPalace y los benchmarks fueron escritos por un desarrollador contratado, Lu, que no aparece ni como coautor ni en el README. Todo el historial de git se aplanó en un solo commit y se reescribió en la cuenta de Milla Jovovich (que tiene 2 días activos en GitHub en toda su historia).

Pero el marketing es una cosa. ¿Y qué hay de los resultados reales?

Brecha entre el README y la realidad
Especialistas en memoria de agentes realizaron una auditoría completa y abrieron un issue, y resultó que la documentación del proyecto es una colección de cuentos de los hermanos Grimm:

1️⃣ "96.6% en LongMemEval"
Esto se presentaba como un logro de su "Palacio de la Memoria". En realidad, esta puntuación se obtuvo en modo raw, es decir, buscando en texto crudo, sin comprimir "de fábrica" en ChromaDB. La arquitectura de habitaciones y salas ni siquiera se utilizó. Simplemente midieron los embeddings predeterminados de ChromaDB y los presentaron como su innovación.

2️⃣ "Compresión 30x sin pérdidas" (AAAK)
Esto no es compresión en absoluto. Es un script cutre basado en expresiones regulares que simplemente trunca las oraciones a 55 caracteres. No se puede recuperar el texto original a partir de esto (algoritmo con pérdidas). ¿Y saben cómo contaron los tokens para afirmar una compresión 30x? Mediante código duro len(text) // 3.
Por cierto, al activar esta "compresión", la puntuación en los benchmarks cae del 96.6% al 84.2%.

3️⃣ "Detección automática de contradicciones"
En el código knowledge_graph.py simplemente no existe. Los hechos se almacenan sin más en una SQLite local.

4️⃣ "+34% de mejora gracias a la arquitectura del Palacio"
Esto es un simple filtrado por metadatos (cuando reducimos la búsqueda a un wing o room específico). Una característica estándar de cualquier base de datos vectorial desde tiempos inmemoriales, no un avance en RAG.

🏳️ Arrepentimiento
Cuando el asunto se puso feo, los autores publicaron una actualización en el repositorio. "Lo siento, contamos mal los tokens, la compresión es con pérdidas, la detección de contradicciones aún no está conectada, y las métricas las embellecimos un poco".
"Gracias por la crítica brutal y honesta", escribieron. Claro, cuando la comunidad los pilló con las manos en la masa manipulando los benchmarks.

Envolver métodos estándar de la biblioteca ChromaDB en una bonita metáfora de "Palacios de la Mente", sazonar con una cara mediática y proclamar una revolución: eso es lo que hace el hype vivificante de la IA.