Alibaba entra en la guerra de las IA y lanza Qwen2.5-Max para competir con DeepSeek

El nuevo modelo de código abierto supera a su competidora china en tareas como la comprensión del lenguaje, matemáticas y programación.
Mascota de oso (texto en la camiseta: "Qwen") lanzando sobres rojos; fondo rojo festivo con fuegos artificiales y patrones de olas repetitivos. Texto en la imagen: "Qwen2.5 - Max".
29 enero, 2025

La carrera por hacerse con el modelo de IA más avanzado y eficiente está en pleno desarrollo. No pasaron ni 7 días de la irrupción de DeepSeek, que Alibaba ya ha lanzado su modelo inteligencia artificial más reciente, Qwen2.5-Max, diseñado para superar a sus mayores competidores: GPT-4o de OpenAI, Llama-3.1-405B de Meta y, principalmente, a  DeepSeek-V3, que hasta el momento era el mejor de todos.

La nueva herramienta ya está disponible en Qwen Chat, el chatbot de la compañía, pero también puedes acceder a ella a través de Hugging Face, el repositorio en GitHub y ModelScope, la plataforma de código abierto desarrollada por Alibaba Cloud. Analizamos sus principales características Qwen2.5-Max y las diferencias con DeepSeek-V3.

Qué es Qwen2.5-Max

Qwen2.5-Max es un modelo de lenguaje de gran escala (LLM) desarrollado por Alibaba Cloud -también conocida como Aliyun-, la división de computación en la nube del Grupo Alibaba. Este modelo se basa en una arquitectura de Mixture of Experts (MoE), una técnica de aprendizaje automático que activa únicamente las partes necesarias para una tarea específica, optimizando el uso de recursos y mejorando la eficiencia.

Entrenado con más de 20 billones de tokens de alta calidad, Qwen2.5-Max ha sido refinado mediante técnicas de ajuste supervisado y aprendizaje por refuerzo a partir de retroalimentación humana. Está diseñado para sobresalir en tareas como programación, razonamiento y conversación, soportando más de 29 idiomas y una longitud de contexto de hasta 128.000 tokens.

Características principales de Qwen2.5-Max:

  • Emplea una arquitectura MoE que optimiza el uso de recursos al activar solo las partes necesarias del modelo, conocidas como “expertos”, para cada tarea específica.
  • Ha sido preentrenado con más de 20 billones de tokens y mejorado mediante técnicas de ajuste supervisado (SFT) y aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), lo que potencia su capacidad de comprensión y generación de lenguaje natural.
  • Rendimiento superior en benchmarks: en evaluaciones como MMLU-Pro, LiveCodeBench y Arena-Hard, Qwen2.5-Max ha superado a modelos líderes como DeepSeek-V3 y GPT-4o, demostrando su eficacia en tareas de conocimiento general, programación y razonamiento complejo.

Comparativa entre Qwen2.5-Max y DeepSeek

DeepSeek ha ganado atención recientemente por sus modelos de IA de alto rendimiento y bajo costo. Sin embargo, Qwen2.5-Max supera a DeepSeek-V3 en varias pruebas de referencia. Por ejemplo, en el benchmark de Arena-Hard, que se aproxima a las preferencias humanas, el modelo de Alibaba supera en casi 4 puntos a DeepSeek.

En MMLU-Pro, que evalúa el conocimiento a través de problemas de nivel universitario, Qwen2.5-Max también obtuvo una puntuación superior. Incluso en evaluaciones como LiveCodeBench y LiveBench, que miden capacidades de codificación y rendimiento general, respectivamente, Qwen2.5-Max tuvo un desempeño superior, no solo a DeepSeek, sino a toda la competencia.

Aunque ambos modelos utilizan la arquitectura MoE, Qwen2.5-Max ha refinado su implementación para lograr una mayor eficiencia y eficacia en diversas tareas.

Comparativa entre Qwen2.5-Max y la competencia. Fuente: Github

Incluso comparando a Qwen2.5-Max con modelos anteriores de Alibaba, se puede ver una superioridad en varios parámetros analizados, especialmente en tareas como la comprensión del lenguaje, matemáticas y programación.

Analizamos el cuadro comparativo en detalle:

  • MMLU (Massive Multitask Language Understanding): evalúa comprensión en múltiples disciplinas (ciencia, matemáticas, historia, etc.). Qwen2.5-Max (87.9) supera a DeepSeek-V3 (87.1), LLaMA3.1-405B (85.2) y Qwen2.5-72B (86.1), indicando una mayor capacidad en conocimientos generales.
  • MMLU-Pro es similar a MMLU, pero con preguntas más avanzadas y difíciles. Qwen2.5-Max (69.0) lidera, con DeepSeek-V3 (64.4) y LLaMA3.1-405B (61.6) rezagados. Esto sugiere que tiene mejor capacidad en problemas más complejos.
  • BBH (Big Bench Hard) prueba preguntas de razonamiento difíciles. Qwen2.5-Max (89.3) es superior, destacando en razonamiento avanzado frente a DeepSeek-V3 (87.5) y LLaMA3.1-405B (85.9).
  • C-Eval es una evaluación centrada en el idioma chino. Qwen2.5-Max (92.2) supera claramente a sus competidores (DeepSeek-V3 90.1, LLaMA3.1-405B 72.5), mostrando una ventaja en este idioma.
  • CMMLU es una evaluación de conocimiento multicultural. Qwen2.5-Max (91.9) lidera, indicando mayor precisión en preguntas culturales y académicas.
  • HumanEval es una evaluación de generación de código en Python. Qwen2.5-Max (73.2) está por encima de sus competidores, lo que indica mejor habilidad en programación.
  • MBPP (Multi-Turn Programming Benchmark), evalúa la capacidad de resolver problemas de programación en múltiples pasos. Qwen2.5-Max (80.6) se impone, destacando en lógica de codificación.
  • CRUX-I y CRUX-O son pruebas de razonamiento crítico y lógica. Qwen2.5-Max supera en casi 10 puntos a DeepSeek.
  • GSM8K es una evaluación de problemas matemáticos de primaria en inglés. Qwen2.5-Max (94.5) es el líder absoluto en esta categoría, mostrando la mejor capacidad en matemáticas.
  • MATH indica una evaluación de problemas matemáticos avanzados. Qwen2.5-Max (68.5) supera a sus competidores, con LLaMA3.1-405B (53.8) en la última posición.

Diferencias con modelos anteriores de Alibaba

En comparación con versiones anteriores, Qwen2.5-Max representa un avance notable en términos de capacidad y rendimiento. Mientras que los modelos previos de la serie Qwen ya ofrecían capacidades multilingües y especialización en áreas como codificación y matemáticas, Qwen2.5-Max amplía estas capacidades y mejora su eficiencia gracias a la arquitectura MoE. Además, su entrenamiento con una cantidad significativamente mayor de datos le permite manejar contextos más largos y realizar análisis más complejos.

Además de Qwen2.5-Max, Alibaba Cloud también ha presentado otro modelo, el Qwen2.5-VL, una evolución significativa de su predecesor Qwen2-VL, que está disponible en tamaños de 3, 7 y 72 mil millones de parámetros, incluyendo versiones base y ajustadas para instrucciones.

Esta nueva variante incorpora potentes capacidades de análisis de documentos, permitiendo analizar archivos de gran tamaño en múltiples idiomas y reconocer elementos como tablas, gráficos, fórmulas químicas y partituras musicales. Además, permite la generación de salidas estructuradas, transformando datos no organizados en formatos como JSON, y funciona como un agente visual autónomo, ejecutando tareas en dispositivos inteligentes.

Foto: Qwen.

Otros artículos de

Publicado por

Content Manager de Marketing4ecommerce
Periodista y Content Manager de Marketing4ecommerce desde 2021. Más de 180 artículos publicados sobre marketing y comercio online.

Suscríbete a M4C

Únete a nuestro canal de Telegram

¡Todo lo que necesitas saber!

Apúntate a nuestra newsletter y recibe gratis en tu correo nuestros mejores artículos sobre eCommerce y marketing digital.