AMD asegura que sus agentes de IA ejecutan tareas locales más rápido y a menor costo que la competencia. Este enfoque deja atrás la métrica tradicional de los chatbots (tokens por segundo) para enfocarse en el tiempo total de trabajo completado: un proceso más económico, 100% local, sin internet y con total privacidad de datos.
La comparación se hizo con una carga de trabajo diseñada para medir el proceso de punta a punta, no el rendimiento aislado del modelo. En ese ensayo, AMD informó que su sistema completó el flujo de trabajo en 311,6s, frente a 367,1s de NVIDIA, una diferencia de 55,5 segundos.
PUBLICIDAD
El punto de partida del planteo es que la adopción de agentes crece con rapidez, pero en la mayoría de los casos esas herramientas todavía realizan la inferencia en la nube. Ese esquema implica costos de API, salida de datos confidenciales del dispositivo y dependencia de la conexión de red para que el flujo de trabajo funcione.

Ejecutar la inferencia de forma local cambia esas condiciones: elimina el costo por token en la nube, mantiene los datos dentro de la máquina, permite operar sin conexión y reduce la latencia. La pregunta que organiza toda la prueba es si una carga de trabajo de agente realista puede ejecutarse localmente con resultados competitivos.
PUBLICIDAD
Cómo cambian los flujos de trabajo con los agentes de IA
AMD sostiene que los flujos de trabajo con agentes no se parecen a una única tarea de generación en GPU. Los describe como una cadena de orquestación e inferencia que puede incluir análisis de archivos, OCR, segmentación, incrustación, recuperación, generación y validación.
Esa estructura modifica los indicadores de rendimiento. En la etapa de los chatbots, la atención estaba puesta en el tiempo hasta el primer token y en los tokens por segundo; en los agentes, la evaluación pasa al trabajo completado y validado, así que los KPI cambian al tiempo de finalización de extremo a extremo y al costo por flujo de trabajo terminado.
PUBLICIDAD

La compañía remarca que la generación de tokens es solo una parte del recorrido. La preparación de documentos, la incrustación y recuperación de evidencia, el movimiento de datos entre motores y la validación de la salida pueden consumir una parte importante del tiempo total.
De qué forma AMD midió le trabajo de los agentes de IA
El ensayo se apoyó en HEPA, sigla de Hermes Executive Presentation Agent, un agente local al que se le encargó producir una presentación ejecutiva lista para directorio, un memorándum de apoyo, gráficos y un apéndice de fuentes citadas a partir de un conjunto de datos local fijo.
PUBLICIDAD
Ese repositorio imitaba una gran unidad compartida de un dispositivo, con archivos relevantes mezclados con material redundante, antiguo, contradictorio y fuentes escaneadas o derivadas de imágenes que exigían OCR real.
La medición se hizo con 302 fuentes locales y 801 fragmentos preparados. El orquestador fue Qwen3.6-35B-A3B, descrito como una mezcla de expertos con cerca de 3B activos y 4 bits, servido a través de llama.cpp; para incrustaciones se usó FastEmbed ONNX nomic-embed-text-v1.5 y para OCR, Tesseract en la CPU.
PUBLICIDAD
Ambas máquinas usaron el mismo corpus, el mismo modelo y la misma configuración. Las dos plataformas completaron cinco de cinco ejecuciones válidas y 25 de 25 comprobaciones deterministas.
Por qué el trabajo de la IA ya no depende de la GPU
El argumento técnico central de AMD es que la mayor parte del trabajo de un agente no recae en la GPU. En la configuración evaluada, siete de las ocho etapas del pipeline se ejecutaron en la CPU, mientras la generación de tokens quedó en la GPU.
PUBLICIDAD
Según la compañía, ese reparto explica por qué un sistema equilibrado puede imponerse incluso si pierde en inferencia pura. AMD indicó que su dispositivo usó llama.cpp con Vulkan, mientras que el sistema de NVIDIA corrió llama.cpp con CUDA.

En la etapa de preparación del lado de la CPU, AMD Ryzen AI Max+ 395 registró 152,1 segundos contra 229,9 segundos de NVIDIA DGX Spark, lo que equivale a una ventaja del 34% en orquestación. El componente decisivo estuvo en las incrustaciones y el enrutamiento: 71,5 segundos frente a 139,6 segundos.
PUBLICIDAD
Asimismo, la empresa calculó un costo por flujo de trabajo completado un 27% menor. Sobre una base de hardware amortizado a tres años con uso continuo y sin incluir energía, el costo fue de unos 0,0132 dólares por flujo de trabajo para AMD frente a unos 0,0182 dólares para DGX Spark.
La compañía atribuye su ventaja al procesador Ryzen AI Max+ 395, con 16 núcleos Zen 5 y 32 subprocesos mediante SMT, sumado a la aceleración vectorial AVX-512/VNNI y herramientas nativas x86 para la pila de documentos y recuperación.
PUBLICIDAD
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
La inteligencia artificial impulsa la competitividad en Colombia, pero la brecha de talento es el gran reto
Estimaciones del Foro Económico Mundial proyectan un potencial económico enorme si se acelera implementación, pero la oportunidad depende de rediseñar procesos y usar tecnología con objetivos claros
Cómo saber en un minuto si una de tus contraseñas fue filtrada en internet
Las filtraciones de datos son frecuentes, pero puedes verificar en segundos si tus contraseñas están en riesgo

El iPhone Air 2 no sería una gran revolución, pero Apple apostaría por dos cambios: isla dinámica y cámaras
La próxima versión apuntaría a pequeñas mejoras, incluyendo una segunda cámara en la parte trasera
Precio de ethereum, bitcoin y otras principales criptomonedas para este martes 4 de agosto
Así se han movido las criptomonedas en las últimas horas

Crean un sensor blando de luz para monitorear la actividad del corazón y el cerebro
Ingenieros de la Universidad de Nueva Gales del Sur desarrollaron un dispositivo que convierte señales eléctricas en información luminosa. Probado hasta ahora en animales y cultivos celulares, apunta a reducir el daño en los tejidos y la interferencia de los implantes tradicionales



