Suscríbete
Edición #13528 de agosto de 2026

Softwall #135 — IA de terminal, benchmarks y humo

📡 Esta semana viene cargadita de agentes, benchmarks y otro poco de postureo con IA, pero también hay cosas bastante útiles de verdad. En repos, lo que más ha petado es codex en terminal, una alternativa local-first a Logitech Options+ y un Linux muy opinionado que ya sabes que o lo amas o lo odias. En noticias, el salseo va de cómo medir de verdad a los modelos y de por qué los modelos pequeños ya no son la broma de antes.

🔧 Herramientas que están petando

GitHub★ 119334 · +12358 esta semana

codex — Rust ficha →

Agente de programación ligero que corre en el terminal. Va al grano: te ayuda a currar sin montar una feria de herramientas alrededor.

Veredicto: Para quien quiere probar un agente de código sin liarse demasiado y ya trabaja cómodo en terminal. Ojo: huele a producto potente, pero también a dependencia de ecosistema y a que no siempre te va a sacar del marrón mejor que tú mismo.

GitHub★ 17207 · +5946 esta semana

OpenLogi — Rust ficha →

Alternativa local-first a Logitech Options+ escrita en Rust. Sirve para remapear botones, DPI y SmartShift por HID++, sin cuenta y sin telemetría.

Veredicto: Muy buena pinta si te toca pelearte con Logitech Options+ y quieres algo más limpio y privado. La pega real es obvia: depende de que tu hardware encaje bien y de que no te falten las pijadas propietarias que a veces solo da el software oficial.

GitHub★ 32782 · +5593 esta semana

omarchy — Shell ficha →

Linux bonito, moderno y con mucha opinión detrás. Es de esas distros/sets que te lo dan todo bastante mascadito, con estilo y decisiones ya tomadas.

Veredicto: Mola si quieres una base visualmente cuidada y con criterio, sin empezar desde cero cada vez. La limitación es clara: si no te va el rollo opinionado, te puede parecer que te han montado una jaula bonita.

📰 Noticias que importan

Hacker News▲ 68

Terminal-Bench-Science evalúa agentes de IA en flujos de trabajo científicos nuestro análisis →

Han sacado un benchmark para medir agentes de IA haciendo curro científico real desde terminal. La gracia no es solo si responden bien, sino si aguantan una tarea larga sin petar ni inventarse una movida rara a mitad de camino. Te importa porque cada vez venden más agentes como si fueran becarios mágicos, y aquí por fin se intenta medirlos en algo más serio que un prompt bonito.

Veredicto: Útil para quien quiera comparar agentes con algo más cercano a trabajo real. La pega es la de siempre: el benchmark puede quedarse corto frente a la complejidad del mundo real, así que no lo compres como verdad absoluta.

Hacker News▲ 448

El vocabulario que sostiene a Claude nuestro análisis →

Un análisis curioso sobre qué palabras y patrones parecen ser clave para que Claude funcione mejor. Es de esas piezas que te hacen flipar un poco porque enseñan que muchas veces el rendimiento depende de detalles más tontos de lo que parece. Te interesa si curras con prompts, evals o sistemas alrededor de LLMs y quieres entender dónde se rompe la magia.

Veredicto: Interesante como lupa para entender comportamiento de modelos y prompts. El límite es que esto no te da una receta universal: puede ser una observación útil, pero también una foto bastante específica de un modelo concreto.

Hacker News▲ 595

Los modelos pequeños han llegado nuestro análisis →

La conversación va de que los modelos pequeños ya no son un apaño cutre, sino una opción seria para muchas tareas. Con mejores costes, menos latencia y despliegues más manejables, empiezan a molar de verdad para producto. Te importa porque no todo necesita un monstruo gigante quemando pasta y CPU a lo loco.

Veredicto: Muy relevante para quien diseña producto, infra o coste de inferencia. La pega es que no sirven para todo: si necesitas razonamiento pesado o máxima cobertura, el modelo pequeño puede quedarse corto y hacerte un buen marrón.

✍️ Devs escribiendo

dev.toa2a

Mezcla y gana: un agente, tres nubes, un protocolo

por xbill · Compara el mismo agente montado en tres nubes distintas usando A2A v1.0. Sirve para ver qué cambia de verdad entre plataformas y qué tienes que mantener constante para no autoengañarte.

🎓 Research del bueno

ArXivcs.SE

SWE-Prime: menos trayectorias, mejor rendimiento nuestro análisis →

Dicen que no hace falta meter toneladas de ejemplos de agentes para enseñar a un modelo a arreglar bugs reales. La idea es filtrar mejor las trayectorias de entrenamiento, porque una trayectoria exitosa también puede traer pasos malos, redundantes o peligrosos. En llano: menos basura en el entrenamiento puede dar mejores resultados que acumular logs a saco.

📚 Aprende esta semana

Tutorial

Cómo sacar datos estructurados fiables de un LLM

Te enseña a no quedarte en el típico JSON.parse(response.content), que funciona cuatro veces y luego te explota en producción. Aprenderás a sacar respuestas más robustas, con menos sustos cuando el modelo te devuelve basura o medio JSON roto.

Semana de no tragarse el humo: benchmarks mejores, modelos pequeños más serios y agentes que por fin se ponen a currar en entornos reales. Si algo mola de verdad, es porque te ahorra marrones; si no, es postureo con LEDs.