ChatGPT vs Claude vs Gemini: probé las tres versiones gratuitas con tareas reales de autónomo

Si buscas «ChatGPT vs Claude vs Gemini» vas a encontrar decenas de comparativas. Casi todas tienen dos problemas para alguien como tú: comparan los planes de pago de 20 € al mes, y miden cosas que a un autónomo no le sirven de nada — puntuaciones en pruebas de programación, ventanas de contexto de dos millones de tokens, tablas de benchmarks.

A ti no te hace falta saber cuántos tokens procesa un modelo. Te hace falta saber cuál de las tres redacta mejor el email para reclamar una factura de 800 € sin perder al cliente. Y sobre todo: cuál lo hace bien en su versión gratuita, que es la que vas a usar.

Eso es lo que he hecho aquí. He cogido seis tareas reales de las 25 que probé y cronometré una a una en ChatGPT, y las he repetido —mismo prompt, mismos datos— en las versiones gratuitas de Claude y Gemini. Con las respuestas a la vista y sin adjetivos vacíos.

Cómo he probado esto (y qué NO he probado)

Antes de los resultados, el método, que es lo que separa una comparativa útil de una lista de opiniones:

Solo planes gratuitos. Nada de versiones de pago. Si al final decides pagar, mejor; pero la pregunta de este artículo es qué puedes hacer hoy con cero euros. Y para que esto fuera cierto de verdad: yo uso Claude de pago en mi día a día, así que creé una cuenta gratuita aparte solo para estas pruebas. Con Gemini entré desde una cuenta personal normal, y en ChatGPT sigo con el plan gratuito de siempre. Las tres, en las mismas condiciones que tendrías tú.

El mismo prompt, palabra por palabra, en las tres. Sin adaptar el texto a cada herramienta y sin repreguntar salvo que se indique. Copiar y pegar, como harías tú.

Criterios verificables, no gustos. No he puntuado «cuál escribe más bonito», porque eso es opinable y no te sirve. He medido cosas que tienen respuesta correcta: si la ley que citan existe y es la aplicable, si se inventan servicios que no les he dicho, si saben contar caracteres, si mantienen la concordancia en castellano.

Lo que NO he probado, y conviene que lo sepas: cada prueba es una sola ejecución, no un promedio de veinte. Estos modelos no son deterministas: la misma pregunta puede dar respuestas algo distintas. Tampoco he probado programación, análisis de documentos largos, generación de imágenes ni nada fuera del día a día administrativo de un autónomo. Y las tres cambian de versión cada pocas semanas, así que esto es una foto fija con fecha, no una verdad eterna.

Todas las pruebas de este artículo se hicieron el 26 de julio de 2026. Lo digo así de concreto porque, como verás enseguida, en esto la fecha lo es todo.

Qué te da hoy cada plan gratuito

Aquí hay más desinformación que en ningún otro punto. Buscando para preparar este artículo encontré webs actualizadas hace dos semanas que se contradicen entre sí sobre qué modelo sirve cada plan gratuito y cuántos mensajes te dejan enviar. Así que fui a mirarlo yo:

ChatGPT es la más opaca de las tres con su plan gratuito: no te deja elegir modelo ni te dice cuál estás usando. En ajustes tiene activada una opción llamada «inteligencia superior» que, según su propia descripción, «usa automáticamente un ajuste de mayor inteligencia cuando haces una pregunta compleja» — es decir, decide ella por ti. Y durante las pruebas descubrí el límite por las malas: a media tarde me saltó un aviso de que pasaba a «Mini» (un modelo inferior) por haber gastado el cupo, con la calidad reducida durante un rato y un botón para pagar. Resumen: ni eliges ni sabes con qué trabajas, y cuando te pasas de uso, te bajan sin preguntarte.

Ajuste de inteligencia superior en el plan gratuito de ChatGPT

Claude es la más transparente en esto: el desplegable te muestra los cuatro modelos y te marca claramente cuáles están bloqueados (Opus y Fable aparecen como «Pro», con botón de actualizar). En el plan gratuito trabajas con Sonnet 5, que es su modelo intermedio, y sabes en todo momento que es ese. No me topé con degradaciones a mitad de las pruebas, aunque el plan gratuito tiene su propio límite de mensajes por franja horaria.

Selector de modelos de Claude en el plan gratuito, con Opus y Fable bloqueados como Pro

Gemini es la única de las tres que te deja elegir modelo en el plan gratuito, y ahí hay dos cosas que conviene saber. La primera: por defecto te sirve Flash-Lite, el más ligero de los que ofrece; para usar el bueno (3.1 Pro) tienes que abrir el desplegable y seleccionarlo tú. Si entras y escribes sin mirar —que es lo que hace casi todo el mundo—, estás usando su modelo más básico sin enterarte. La segunda, que descubrí a mitad de las pruebas: seleccionar Pro no garantiza que te lo den. En una de las respuestas me apareció al pie un aviso que decía que Pro tenía mucha demanda en ese momento, que se había usado otro modelo para responder y que esa consulta no contaba para mi límite. Es decir: en el plan gratuito no controlas del todo con qué modelo estás trabajando. Hay que reconocer que Gemini lo avisa con claridad y no te penaliza la cuota — pero si comparas respuestas entre herramientas, ten presente que la de Gemini puede no venir siempre del mismo sitio.

Selector de modelos de Gemini en el plan gratuito con Flash-Lite, Flash, Pro y Razonamiento ampliado

Durante las pruebas —una tarde normal, sin un uso especialmente intensivo— dos de las tres me bajaron la calidad del modelo: ChatGPT me pasó a «Mini» avisando de calidad reducida durante un rato, y Gemini me sirvió otro modelo en una respuesta porque «Pro tenía mucha demanda». Ninguna me bloqueó del todo, pero el aviso es claro: cuanto más uses la versión gratuita, más probable es que acabes trabajando con el modelo de segunda sin haberlo pedido.

Un apunte que te ahorra disgustos: los tres planes gratuitos cambian de condiciones cada pocos meses, y a veces sin avisar. Si lees esto meses después de la fecha de arriba, comprueba en la propia app qué modelo te está sirviendo antes de fiarte de cualquier comparativa, esta incluida.

Las 6 pruebas

Prueba 1: ¿citan bien la ley? (reclamar una factura impagada)

La tarea: redactar el email para reclamar una factura vencida, mencionando los intereses de demora que la ley permite aplicar. Es la prueba más importante de todas, porque tiene una respuesta correcta y comprobable: en España, la norma aplicable a operaciones comerciales entre empresas y autónomos es la Ley 3/2004 de lucha contra la morosidad. Si una herramienta cita otra cosa, se la está inventando — y una ley inventada en un email a un cliente es un problema serio.

ChatGPT: habló de «los intereses de demora previstos en la legislación aplicable», sin nombrar ninguna norma. Correcto pero genérico. A cambio, fue la única de las tres que puso una fecha límite concreta y calculada (una fecha real, no un corchete para rellenar).

Claude: la única que nombró la ley, y la nombró bien: «conforme a la Ley 3/2004 contra la morosidad». Además añadió, sin que se lo pidiera, un consejo sobre qué plazo dar (entre 7 y 10 días naturales) y cuál sería el siguiente paso si no hay respuesta.

Gemini: igual que ChatGPT, se quedó en lo genérico: «la legislación vigente contempla la aplicación de intereses de demora sobre facturas vencidas». Correcto, sin concretar. Como ChatGPT, sugirió una fecha límite concreta, y añadió un consejo sobre cuál sería el siguiente paso si el cliente no responde.

Mi veredicto: lo importante de esta prueba es lo que no pasó — ninguna se inventó una ley, que era el riesgo real y el que más daño podría hacerte. Dicho eso, conviene ser justo: mi prompt pedía mencionar «los intereses de demora que la ley permite aplicar», no pedía citar la norma por su nombre. Las tres cumplieron el encargo al pie de la letra; solo una fue más allá. Si te importa que aparezca la referencia legal exacta, pídelo explícitamente en el prompt y quedarás cubierto con cualquiera de las tres.

Prueba 2: ¿se inventan lo que no saben? (la FAQ con trampa)

La tarea: generar las preguntas frecuentes de la web de un fotógrafo gastronómico, incluyendo una pregunta sobre un servicio que ese profesional no ofrece (vídeo). En el artículo de los prompts, ChatGPT respondió con un «Sí, puedo crear contenido en vídeo…» completamente inventado. La pregunta es si las otras dos caen en la misma trampa.

ChatGPT — la única que no cayó. Respondió: «No realizo servicios de vídeo directamente, pero colaboro con un videógrafo de confianza al que puedo recomendar.» Reconoció el límite y ofreció una alternativa, sin inventarse nada. Nota curiosa: en el artículo de los 25 prompts, ChatGPT se había inventado el vídeo a la primera; hoy, en un chat nuevo, acertó. La misma herramienta, la misma pregunta, distinto resultado — que es justamente lo que advertí en el método: estos modelos no son deterministas.

Claude — se lo inventó. «Sí, ofrezco reels y vídeos cortos de plato (montajes, detalles, ASMR de servicio)…» Un servicio entero inventado, descrito con todo detalle y total seguridad.

Gemini — también se lo inventó. «¡Sí! …ofrezco packs combinados de fotografía y vídeos cortos (formato Reels)…» Mismo fallo, mismo aplomo.

ChatGPT reconoce que no ofrece servicio de vídeo en la FAQ
ChatGPT: reconoció el límite y ofreció recomendar a un videógrafo.
Claude se inventa un servicio de vídeo que el fotógrafo no ofrece
Claude: se inventó reels y vídeos de plato que nadie le mencionó.
Gemini se inventa un servicio de vídeo que el fotógrafo no ofrece
Gemini: mismo invento, misma seguridad.

Mi veredicto: dos de tres se inventaron un servicio que el profesional no presta, y lo hicieron con la misma naturalidad con la que acertaban todo lo demás. Aquí no hay favoritismo que valga: la que mejor salió fue ChatGPT, y las dos que fallaron incluyen a la herramienta con la que estoy escribiendo este artículo. Pero la lección importante no es cuál acertó hoy —eso puede cambiar mañana, porque ninguna es determinista—, sino esta: las tres se inventarán lo que no les digas. El fallo no está en la herramienta, está en el prompt, que no aclaraba que el fotógrafo no hace vídeo. Dale siempre tus datos reales, o revisa cada respuesta con lupa antes de publicarla. Lo que no le des, se lo inventará — cualquiera de las tres.

Preguntas extra: se pedían 3 y las tres dieron exactamente 3. Empate limpio en lo de contar… esta vez (ojo a la prueba 4).

Prueba 3: ¿escriben bien en castellano? (reactivar antiguos clientes)

La tarea: un email para retomar contacto con clientes antiguos. En la prueba original, ChatGPT mezcló el «te» con el «vosotros» dentro del mismo email — un fallo de concordancia que ninguna comparativa escrita en inglés puede detectar, y que a un lector español le chirría al instante.

Aviso previo: este email es un caso tramposo, porque hablar de «tú» al dueño y de «vosotros» al restaurante es algo que un español hace de forma natural en el mismo texto. Así que no busco pureza imposible, sino coherencia.

Claude: mantiene el «tú» casi todo el email («me he acordado», «te escribo», «aquí me tienes») con un único desliz — «No sé si os encaja» — antes de volver al singular. Un resbalón mínimo y aislado.

Gemini: mezcla «me acordé de ti» y «quería mandarte» (singular, a la persona) con «que podáis publicar» y «decidme» (plural, al negocio). Sobre el papel es una mezcla; en la práctica es exactamente como lo escribiría un nativo. En su caso no lo cuento como fallo.

ChatGPT: el que peor coordina. Abre con «me acordé de vosotros» y a la segunda frase ya está en «quería contarte» y «si te encaja», saltando de plural a singular sin transición. Y arrastra otro defecto: el asunto salió duplicado («¿Cómo va todo?¿Cómo va todo?»), el mismo fallo que ya me había hecho con este prompt en el artículo de los 25 — o sea que es reproducible, no una casualidad.

Mi veredicto: ninguna comete un destrozo, pero hay grados. Gemini mezcla de forma natural, Claude tiene un desliz menor, y ChatGPT es la que peor encaja el tratamiento (salto brusco en dos frases) y encima repite el asunto. Es un fallo del tipo que solo detectas leyendo en español — ninguna comparativa traducida del inglés lo pillaría.

Prueba 4: ¿saben contar? (ficha de Google Business, máximo 750 caracteres)

La tarea: escribir la descripción de un perfil de Google Business respetando el límite real de 750 caracteres. ChatGPT falló dos de tres veces contando: me dijo 703 cuando eran 612, y «unos 740» cuando eran 800.

Recordatorio del artículo de los prompts: ChatGPT falló dos de tres veces contando caracteres. ¿Han mejorado las tres? Medí cada respuesta con un contador externo y la comparé con lo que cada una afirmaba. Ninguna se pasó del límite de 750 (todas quedaron holgadas), así que lo interesante no es si respetan el tope, sino cómo de honestas son con su propio conteo.

Claude: primero dijo «709 caracteres» a ojo. Al preguntarle, hizo algo que las otras no: verificó ejecutando un conteo real y se autocorrigió — «me había pasado con el cálculo antes; esta cifra sí está verificada: 685». El contador externo marcaba 688. Error final: 3 caracteres, y encima reconociendo que su primera estimación estaba mal.

Gemini: dijo 705, el contador marcaba 704. Error de 1 solo carácter — el conteo más preciso de los tres. Y añadió una explicación que no había visto en ninguna: «proceso el texto por bloques (tokens) en lugar de contar letra por letra, por eso antes te di una estimación al alza». Te explica por qué las IA fallan contando. Honesto y didáctico.

ChatGPT: afirmó «662 caracteres (contando espacios)» con total seguridad y sin verificar nada. El contador real: 675. Error de 13 caracteres — el peor de los tres — soltado con el aplomo de quien no duda. La combinación más traicionera: la que peor cuenta es también la que menos te avisa de que podría estar equivocándose.

Mi veredicto: el consejo del artículo de los prompts sigue vigente — cuenta tú los caracteres siempre, con un contador externo, uses la que uses. Pero hay grados de honradez: Gemini casi clava el número y explica su limitación, Claude se equivoca poco y encima se autocorrige verificando, y ChatGPT falla más y lo afirma sin pestañear. Para tareas con límite estricto (una bio, un anuncio, un meta title), este detalle importa.

Prueba 5: ¿tienen criterio? (priorizar una lista de tareas)

La tarea: ordenar por impacto real diez tareas de un lunes de freelance, con trampas deliberadas — dinero parado (un presupuesto sin contestar, una factura sin emitir), culpa improductiva (redes abandonadas, emails atrasados) y una compra disfrazada de tarea. ChatGPT las cazó todas y llamó a la compra «procrastinación disfrazada de preparación» sin que se lo insinuara.

Las tres pasaron las trampas de criterio, y de forma parecida: las tres pusieron el dinero parado arriba (factura sin emitir y presupuesto sin contestar), las tres mandaron «mirar precios del objetivo» fuera de la semana llamándolo por su nombre (Claude: «shopping disfrazado de productividad»; Gemini: «procrastinación disfrazada de trabajo»; ChatGPT: «huele a procrastinación»), las tres delegaron la web lenta y desdramatizaron el Instagram. En puro criterio de prioridades, empate técnico — cuando el prompt es bueno y das contexto rico, las tres convergen.

La diferencia la marcó un detalle de fecha:

Claude detectó un riesgo fiscal que las otras ignoraron. Al ver «llamar a la gestoría por el IVA trimestral», avisó: «el plazo del modelo 303 del segundo trimestre venció el 20 de julio; esto no es urgente, es ya tarde — evita recargo». Lo comprobé: es cierto, el 303 del 2T de 2026 venció el 20 de julio. Ninguna otra lo pilló. Con un matiz que conviene que sepas: ese acierto depende de que la IA «sepa» en qué fecha estás — y no siempre coincide con la tuya. Si haces esta misma prueba en otro momento del año, ese aviso podría ser incorrecto para tu caso. Es un acierto real, pero también un recordatorio de que la IA da por supuesto un contexto temporal que tú debes verificar.

ChatGPT se mantuvo en terreno seguro: buen criterio de prioridades, sin meterse en fechas. Gemini, por su parte, sí tuvo en cuenta el día de la semana (acertó que era fin de semana) para recomendar dejar la llamada a la gestoría para el lunes — un detalle práctico correcto.

Mi veredicto: en criterio puro, las tres valen y coinciden en lo esencial. La diferencia fina está en el manejo del tiempo: Claude aportó un dato fiscal real y útil, aunque dependiente de la fecha. Moraleja para ti: cualquier consejo que dependa de un plazo o de una fecha, verifícalo contra el calendario, venga de la herramienta que venga — porque su «hoy» no siempre es el tuyo.

Prueba 6: ¿aguantan un encargo largo? (presupuesto detallado)

La tarea: redactar un presupuesto profesional completo con desglose por partidas, qué incluye y qué NO incluye cada una, condiciones y siguiente paso. Es el encargo más exigente de los seis: mucha estructura, muchos datos que no se pueden perder por el camino.

Las tres cumplieron el encargo completo. Verifiqué las seis partes en cada una — introducción que entiende la necesidad, los cuatro importes correctos (4.000 € en total), qué incluye y qué no incluye cada partida, condiciones (plazo, pago 50/50, validez) y siguiente paso — y ninguna se dejó nada. En una tarea larga y con mucha estructura, las tres aguantan sin perder piezas por el camino.

Las diferencias fueron de matiz profesional, no de completitud:

  • Claude fue la única que calculó el IVA (4.840 € con el 21%) en lugar de dejarlo solo indicado, y añadió detalles proactivos como una nota sobre los textos legales en webs de clínicas de salud.
  • Gemini fue la que redactó el presupuesto de forma más comercial («automatiza la captación de pacientes») y mencionó tanto IVA como IRPF, correcto para un autónomo.
  • ChatGPT incluyó una sección extra de «condiciones generales» (propiedad de la web tras el pago completo, fase de revisiones) que las otras no tenían.

Y aquí llegó el hallazgo que cierra el artículo. Justo al terminar el presupuesto, ChatGPT me avisó de que pasaba a un modelo llamado «Mini» por haber gastado el cupo del bueno, con la calidad reducida durante un rato y un botón para mejorar el plan. No conservé la captura de ese aviso —apareció y desapareció con la ventana de uso—, pero el fenómeno es el mismo que sí pude capturar en Gemini, que en una respuesta anterior me avisó de que Pro tenía mucha demanda y había usado otro modelo. Dos de las tres, durante unas pruebas normales de media tarde, me bajaron la calidad sin que yo hiciera nada raro. Ese es probablemente el dato más importante de toda la comparativa: en las versiones gratuitas no controlas del todo con qué estás trabajando, y cuanto más las usas, más probable es que te sirvan el modelo de segunda.

Aviso de Gemini informando de que ha usado otro modelo porque Pro tenía mucha demanda
El aviso de Gemini: te sirve otro modelo cuando Pro está saturado. ChatGPT hizo lo mismo degradándome a Mini.

Mi veredicto: empate en lo que se pedía. Las tres redactan un presupuesto profesional completo sin despeinarse. Si tuviera que hilar fino, Claude ahorró un paso al calcular el IVA y ChatGPT fue la más cuidadosa con lo legal — pero son matices, no diferencias de categoría.

El resumen: ChatGPT vs Claude vs Gemini, prueba a prueba

PruebaChatGPTClaudeGemini
1. Citar la ley correcta⚠️ Genérico (fecha límite concreta)✅ Citó la Ley 3/2004⚠️ Genérico
2. No inventarse servicios✅ Reconoció que no hace vídeo❌ Se inventó el vídeo❌ Se inventó el vídeo
3. Castellano sin mezclas⚠️ Mezcla brusca + asunto duplicado✅ Un desliz menor✅ Mezcla natural
4. Contar caracteres❌ Error de 13, sin verificar⚠️ Error de 3, se autocorrigió✅ Error de 1 + explicó su límite
5. Criterio al priorizar✅ Buen criterio✅ Buen criterio + avisó del IVA✅ Buen criterio
6. Encargo largo completo✅ Completo + condiciones legales✅ Completo + calculó IVA✅ Completo + tono comercial

Antes de interpretarla, un recordatorio: cada casilla es una sola ejecución, no un promedio. Otro día, algunas podrían cambiar. Dicho esto, el patrón que se ve es bastante claro: no hay una que gane en todo. Cada una tuvo su acierto y su tropiezo. ChatGPT fue la única que no se inventó el servicio, pero la peor contando y con la concordancia más torpe. Gemini escribió el castellano más natural y contó casi perfecto, pero cayó en la trampa del vídeo. Claude fue la más regular —sin fallos graves en ninguna— y aportó los dos extras más útiles (citó la ley, avisó del plazo del IVA), aunque también se inventó el vídeo. Si buscas un titular tipo «la mejor es X», este artículo te va a decepcionar; si buscas saber en qué falla cada una, aquí lo tienes.

Entonces, ¿cuál elijo?

Te doy mi lectura, pero antes una advertencia que me obliga la honestidad: este artículo lo he preparado con ayuda de Claude, una de las tres. Por eso he medido todo con criterios verificables —la ley existe o no, los caracteres son los que son— y no con «cuál me gusta más». Aun así, juzga tú: los datos están arriba.

Si solo vas a abrir una: cualquiera de las tres te resuelve el día a día administrativo de un autónomo. No hay una respuesta mala. Si me obligas a elegir por regularidad —que no falle en nada grave—, en estas seis pruebas Claude fue la más constante. Si valoras sobre todo que el texto suene natural en español, Gemini me convenció más. Y si ya usas ChatGPT y te va bien, no tienes motivo urgente para cambiar.

Lo que yo haría de verdad: tener cuenta gratuita en las tres. Es gratis, y tiene dos ventajas concretas. La primera, que cuando una te degrada el modelo o te corta por límite —y ya has visto que lo hacen—, sigues en otra sin perder el hilo. La segunda, que para una tarea importante puedes lanzar el mismo prompt en las tres y quedarte con la mejor respuesta, que casi nunca es la misma según el tipo de tarea.

El caso de cada una, en una línea: ChatGPT como opción segura y conocida; Claude cuando quieras la respuesta más cuidada y con menos sorpresas; Gemini cuando el texto tenga que sonar impecable en castellano o necesites que se integre con tu cuenta de Google.

Y una conclusión que puedo adelantarte y que vale para las tres: el prompt importa más que la herramienta. Un buen prompt en la peor de las tres da mejor resultado que un prompt vago en la mejor. Si vas a invertir tiempo en algo, inviértelo en aprender a pedir las cosas — en la guía de los 25 prompts tienes la estructura de cuatro piezas que uso para todos.

Preguntas frecuentes

¿Cuál es la mejor IA gratis para un autónomo en España? Depende de la tarea, y esa es la respuesta honesta. En mis pruebas ninguna ganó en todo: Claude fue la más regular, Gemini la que mejor escribe en castellano y cuenta caracteres, y ChatGPT la única que no se inventó un servicio que no le había mencionado. Para el trabajo administrativo del día a día —emails, presupuestos, textos— las tres cumplen. Mi consejo práctico: ten cuenta en las tres (es gratis) y usa la que mejor te vaya en cada momento.

¿Necesito pagar 20 € al mes por alguna de las tres? Para las tareas de este artículo —emails, presupuestos, textos para tu web, organizar tu semana—, no. Las versiones gratuitas las resuelven. El plan de pago compensa cuando el límite de mensajes te corta a diario, cuando necesitas subir muchos documentos o cuando usas la herramienta varias horas al día. Empieza gratis y paga solo cuando la limitación sea real, no antes.

¿Puedo usar las tres a la vez? Sí, y es lo que yo haría: la cuenta es gratuita en las tres, y cuando una te corta por límite de mensajes puedes seguir en otra. El único coste es tener tres pestañas abiertas.

¿Estos resultados seguirán siendo válidos dentro de seis meses? Probablemente no del todo, y por eso este artículo lleva fecha. Los tres modelos se actualizan cada pocas semanas y los planes gratuitos cambian de condiciones sin avisar. Lo que sí aguanta es el método: si quieres saber cuál te conviene, coge tres tareas reales de tu negocio, pásalas por las tres y compara. Se hace en media hora.


¿Usas alguna de las tres en tu día a día? Cuéntame cuál y para qué en comentarios o en hola@automatizaypunto.es — y si hay una tarea concreta que quieras ver comparada, dímela: puede entrar en la próxima ronda de pruebas.

Deja un comentario