RSS Amplifier

Mafia IA 🤖🛠️ IA para Emprendedores · Aug 8, 2025

GPT-5 primer análisis

0
Sign in to vote or save

Alex dc · Mafia IA 🤖🛠️ IA para Emprendedores

OpenAI acaba de lanzar GPT-5.

Y esto es una publicación rápida para comentaros primeras impresiones y pruebas.

En realidad no era algo planeado, simplemente he estado unas horas haciendo pruebas reales, revisasndo los primeros datos y benchmarks; y en vez de dejarlo como apuntes personales he pensado compartirlo con vosotros.

En todo caso aviso ;)

  1. ❌ NO es una publicación habitual de La Mafia IA.

  2. ⚡️ Es un post rápido a modo casi de apunte personal.

  3. 🎯 Y La Mafia IA seguirá siendo una publicación más orientada a la práctica que a la teoría o información. Como sabéis no somos una newsletter de noticias IA

Pero la verdad que después de 2 años de Salman dando la matraca con GPT-5:

Creo que es difícil pasar por alto el día del lanzamiento.

Y antes de que te subas al tren del hype, quería darte mi opinión sobre el nuevo y esperado modelo.

Porque no es lo que muchos esperaban. No es lo que OpenAI quiere que creas. Pero puede que sí sea lo que ahora mismo necesitaba, al menos OpenAI.

Veámoslo…

Antes de entrar en materia os presento al diseñador del nuevo UI de GPT-5 👇

Y ahora si, vamos directo al grano.

GPT-5 no es un nuevo modelo revolucionario. Es esencialmente la unificación de los modelos O3 y O4 que ya existían, empaquetados bajo un nombre más comercial.

OpenAI simplemente se quitó de encima el yugo de "GPT-5 cuándo, GPT-5 cuándo" y ya está.

💡Los datos técnicos reales:

  • 1M tokens de contexto (400K para la mayoría de usuarios)

  • Arquitectura unificada que decide automáticamente cuándo razonar

  • 94.6% en matemáticas avanzadas (AIME 2025)

  • 74.9% en debugging real (SWE-bench Verified)

  • 45% menos alucinaciones que GPT-4

Suena impresionante, ¿verdad?

Pero aquí viene la parte que no te cuentan...

Las cartas sobre la mesa: GPT-5 No es el modelo más potente, al menos no en todo.

En las comparaciones con Grok a GPT-5 se le ven las costuras y la realidad es que el nuevo modelo está detrás en tareas críticas

Humanity's Last Exam (el benchmark que realmente importa):

  • Grok 4: 25.4% sin herramientas

  • GPT-5: 24.8% (razonamiento activado)

  • GPT-5 (sin razonamiento): 6.3%

¿Ves el problema? Sin su modo "thinking", GPT-5 es desastroso en tareas complejas.

Arc AGI 2 (razonamiento abstracto):

  • Grok 4: 16%

  • GPT-5: 9.9%

*Grok costando 3-4 veces más. Pero el salto en capacidades lo justifica.

  • Gemini 2.5 Pro: Contexto de 1M tokens vs 400K de GPT-5

  • En razonamiento estadístico: Gemini supera a GPT-5 según algunos tests

  • En programación: GPT-5 ligeramente superior

  • Gemini parece responder con una mejor velocidad constante

Claude parece que mantiene una pequeña ventajas en el terreno del código y programación, aunque es algo que veremos mejor los próximos días según tengamos más pruebas:

  • Desarrolladores prefieren Claude para proyectos largos (link)

  • GPT-5 mejor para tareas puntuales y "vibe coding" (link)

  • Claude Code sigue siendo preferido para desarrollo empresarial

GPT-5 es competitivo, no dominante.

Expectativas vs Realidad

Por fin acabó la pesadilla del selector de modelos. Ahora todos los usuarios acceden automáticamente a capacidades de razonamiento sin tener que entender la diferencia entre O1, O3, 4.5, etc.

Esto es genuinamente valioso para los 700 millones de usuarios que no saben optimizar ChatGPT.

  • Más barato que GPT-4.5 por un orden de magnitud

  • API: $1.25 por millón de tokens (input)

  • Finalmente OpenAI eligió ser útil en lugar de caro

Los desarrolladores reportan mejoras reales:

  • Entiende bases de código grandes

  • Mejor debugging que versiones anteriores

  • Puede crear aplicaciones completas en un prompt

Cuando activa el modo "thinking", las respuestas pueden tardar varios minutos.

Usuarios reportan esperas frustrantes, especialmente en horas pico.

  • Te prometen GPT-5 gratis

  • Después de X usos → GPT-5 Mini automáticamente

  • Límites no revelados públicamente

Simple QA benchmark:

  • GPT-5: 0.40 ratio de alucinaciones

  • GPT-4o: 0.48 ratio

Mejora del 17%. Buena, pero no espectacular.

Puede procesar contratos de 200+ páginas y encontrar inconsistencias que requieren horas de trabajo humano.

Aquí sí hay valor real.

Desarrolladores reportan capacidad para refactorizar código legacy y entender arquitecturas complejas.

Procesa literatura extensa y genera síntesis que aceleran revisiones bibliográficas.

Lucha con problemas que requieren seguimiento de múltiples líneas temporales.

Recombina elementos existentes brillantemente, pero crear conceptos genuinamente nuevos... no tanto.

Respuestas técnicamente correctas pero culturalmente tontas.

Este número viene de prompts específicos con búsqueda web activada.

  • Las alucinaciones siguen siendo un problema

  • Especialmente en dominios altamente especializados

  • El modelo suena autoritativo pero sigue equivocándose

No es la solución mágica que prometen.

Aunque es verdad que con los últimos modelos Open Source y la presión de precios de estos. No es de extrañar que OpenAI haya decidido darnos una alegría en este apartado:

  • GPT-5 Nano: Pensada para dispositivos edge y usos que requieren ultra-baja latencia o funcionamiento offline. Es la versión más rápida, ligera y barata.

    • $0.05 entrada/ $0.40 salida (por millón de tokens)

    • Precio variable según modalidad específica y caché, siempre muy bajo.

  • GPT-5 Mini: Rápido y económico, útil para tareas simples y bajo coste

    • $0.25 entrada / $2.00 salida (por millón de tokens)

  • GPT-5 (estándar): Balance ideal entre rendimiento y coste. Precio:

    • $1.25 entrada / $10.00 salida (por millón de tokens)

    • Este modelo es el recomendando para uso profesional estándar y tiene contexto extendido.

  • GPT-5 Pro: Orientado a tareas complejas, mayor memoria y precisión. Precio:

Para la mayoría: NO.

Para uso general, las mejoras no justifican el precio.

GPT-5 representa evolución, no revolución.

La estrategia de OpenAI es clara:

  1. Simplificar el ecosistema caótico de modelos

  2. Hacer que más usuarios accedan a razonamiento avanzado

  3. Competir en precio con Google y Anthropic

¿Es un mal modelo? No. Es sólido.

¿Es el salto que esperábamos? Definitivamente no.

En la presentación mostraron gráficos donde el 59.8% aparecía visualmente MÁS BAJO que el 54.3%. (entre otros fallos de bulto)

Comparado con hace 8 meses: GPT-5 es impresionante.

Comparado con la semana pasada: Es una actualización progresiva.

Y aquí está el problema de expectativas. OpenAI prometió revolución y entregó evolución.

La competencia puede estar tranquila esta noche.

Google tiene espacio para lanzar Gemini 3 la próxima semana y superar fácilmente estos números. 👀

No hay salto abismal. Solo progreso incremental.

GPT-5 es un buen modelo que:

✅ Simplifica la experiencia de usuario
✅ Mejora capacidades de programación
✅ Reduce costes significativamente
✅ Democratiza acceso a razonamiento avanzado

❌ No es revolucionario
❌ Sigue por detrás de Grok 4 en tareas complejas
❌ Tiene problemas de velocidad
❌ Los límites gratuitos son engañosos

La realidad: Es otro escalón en la progresión de LLMs, no el salto al futuro que nos vendieron.

¿Deberías usarlo? Sí, es mejor que GPT-4.

¿Deberías hypearte? No. Mantén los pies en el suelo.

Porque como siempre, el futuro llega paso a paso, no de golpe.

Compartir

PD: OpenAI hizo una presentación tan mala que hasta los fanboys están decepcionados. Eso debería decirte algo sobre las expectativas vs realidad.

El Sardinero - Santander 2025

Aprovecho esta edición rápida para desearos un buen verano y mandaros un saludo desde Santander.

Y también compartir algunos datos de La Mafia IA con vosotros:

Esta es una reseña genuina y no pagada ;)

Hoy te traigo una recomendación que puede transformar cómo te comunicas con tus clientes. Se trata de Alba de 📧 Ekho Comunicación, una experta que salva a emprendedores del mar de la indiferencia.

¿Por qué te recomiendo esto? Porque Alba tiene el don de explicar estrategias de comunicación complejas de forma simple y divertida. Sin tecnicismos aburridos. Sin teoría hueca.

🎙️ El plus: Además cada semana incluye un podcast cortito respondiendo dudas específicas.

Accede Gratis a Ekho Comunicacións

Si te ha gustado esta edición, házmelo saber, no te olvides de dar al ♡

¿Conoces a alguien a quien le pueda ayudar esta información? → compártelo.

* Este correo fue escrito totalmente por un humano. En concreto ☝️ Alex dc ;)

Read the original on aimafia.substack.com

Comments

Nothing yet. Say the first thing.

    Sign in to join the conversation.