Experimentando con GPT Luna
Dos comentarios en Hacker News
Después de leer un par de comentarios en Hacker News, me ha hecho reflexionar sobre los últimos modelos de IA y como ha ido evolucionando todo en los últimos meses.
Por una parte, los útimos modelos de GPT Luna y el último update de Deep Seek Flash
son muy muy baratos. Lo que más me llama la atención es que usar max en estosmodelos parece darle bastante potencia.
Total, que he mirado algunos benchmars y me ha dado por realizar un pequeño experimento.
Benchmarks actuales
En el índice de inteligencia de Artificial Analysis, GPT Luna Max aparece con 51 puntos. Está por detrás de los modelos que encabezan la clasificación, pero ya se encuentra en una zona bastante competitiva.

La segunda captura es todavía más interesante porque compara Luna con modelos que han marcado un punto de inflexión (e.g GPT-4.1 cuando salió, y Claude Opus 4.6, que al menos para mi, marcó el antes y el después en usar IA para programar).

Verlos en el mismo gráfico sirve para recordar lo rápido que se mueve todo esto.
El experimento
He puesto a prueba varios modelos de OpenAI con exactamente la misma tarea y el mismo punto de partida y contexto, para intentar entender si todos los modelos se comportaban igual y si serían capaces de resolverlo. Al final he medido timepo y coste.
Era una tarea de programación relativamente sencilla, pero implicaba buscar a qué me refería en mi prompt, interpretar qué archivos estarían implicados, hacer unos cambios y añadir unos tests.
En realidad este experimento es más anectódico que otra cosa, sin embargo, es interesante ver los resultados:
| Modelo | Tiempo | Coste |
|---|---|---|
| Sol Medium | 208 segundos | 47,7 céntimos |
| Terra High | 67 segundos | 19,1 céntimos |
| Terra Medium | 45 segundos | 13,9 céntimos |
| Luna Max | 96 segundos | 2,7 céntimos |
| Luna Medium | 41 segundos | 1,6 céntimos |
La diferencia de precio es bastante significativa. Si usamos Luna Max como baseline, así quedaría la tabla:
| Modelo | Tiempo | Coste |
|---|---|---|
| Luna Medium | 0.43x | 0.59x |
| Luna Max* | 1.00x | 1.00x |
| Terra Medium | 0.47x | 5.15x |
| Terra High | 0.70x | 7.07x |
| Sol Medium | 2.17x | 17.67x |
Luna medium es bastante más rápido y barato, aunque seguramente no sea capaz de realizar tareas complejas. Si se quiere ahorrar y el tiempo no es un problema, Luna Max es un buen modelo para multitud de cosas. Si no hay problemas de coste, Terra High parece una elección razonable, aunque mucho más cara pero es relativamente rápida. Finalmente Sol es muy muy caro y mucho más lento en comparación con los demás modelos, pero ciertamente es posible que pueda hacer cosas que otros no hacen.
En mi día a día la verdad es que Terra me ha sorprendido bastante. A partir de hoy seguramente usaré Luna Max más a menudo en proyectos personales porque el coste es imbatible.
No tengo claro todavía hasta qué punto puede tener sentido en términos de timepo y monetarios, hacer una primera pasada de una tarea usando modelos más baratos (p.ej. Luna Medium) y después usar Terra High para revisar la implementación y mejorarla, pero desde luego es algo a explorar.
Conclusión
Con estos nuevos modelos más baratos y la capacidad actual, espero que en el futuro podamos ver modelos de similares capacidades y precio pero con 10x o 100x más velocidad.