Portada editorial sobre TEXTO EN PORTADA: "¿Investigan o solo navegan?". Tres ventanas de navegador alineadas como si fueran competidores en una prueba editorial, cada una mostrando una investigación dist

El test de los tres navegadores: ¿puede un agente investigar y demostrarlo?

Los agentes de navegador suelen evaluarse con tareas fáciles de verificar: abrir una página, completar un formulario, buscar un dato o pulsar un botón. Pero una investigación breve exige algo más difícil: decidir qué fuentes consultar, distinguir hechos de interpretaciones, conservar evidencias y explicar de dónde sale cada afirmación.

La propuesta es someter a tres herramientas públicas —browser-use, agent-browser y una configuración basada en Playwright MCP— al mismo encargo editorial. No se trataría de decidir cuál navega más rápido, sino cuál es capaz de producir un texto comprobable sin ocultar sus pasos ni rellenar los huecos con invenciones.

El encargo común

Para evitar que cada sistema resuelva una tarea distinta, el experimento debe usar un único prompt, copiado sin cambios. Un encargo adecuado podría ser este:

Investiga el fenómeno reciente de los agentes personales siempre activos, tomando como punto de partida la comparación entre Meta Muse y OpenAI Dots. Redacta un artículo de entre 700 y 1.000 palabras en español peninsular. Explica qué productos se han anunciado, qué diferencias relevantes existen, qué afirmaciones están respaldadas por fuentes y qué aspectos siguen sin confirmarse. Incluye enlaces a todas las fuentes utilizadas. No inventes citas, cifras, funciones ni resultados. Antes del artículo, entrega un registro breve con las páginas visitadas y la función que cumple cada una.

El tema no es casual. Las informaciones recientes han presentado Muse y Dots como productos parecidos, aunque con diferencias de enfoque y público, según la comparación publicada por Tom’s Guide. También hay cobertura sobre la infraestructura atribuida a Dots en Tom’s Hardware y sobre el lanzamiento de agentes que trabajan de forma continua en TechRadar. El cuarto enlace inicial, sobre el uso intensivo de los agentes y su tendencia a releer información ya disponible, permite comprobar si el sistema sabe contextualizar una afirmación más general: Tom’s Hardware.

Las condiciones para que la comparación sea justa

La unidad de comparación no debe ser únicamente la herramienta. Un agente combina navegador, modelo de lenguaje, instrucciones, memoria y permisos. Por eso hay que fijar todas las variables posibles: mismo modelo, misma temperatura si está disponible, mismo límite de tiempo, mismo número máximo de pasos, mismo entorno sin historial y la misma lista de fuentes iniciales.

También conviene separar dos pruebas. En la primera, los tres sistemas reciben los cuatro enlaces de la ruleta y deben trabajar a partir de ellos. En la segunda, reciben solo el tema y deben descubrir las fuentes por su cuenta. Así se distingue la capacidad de leer y contrastar de la capacidad de encontrar información relevante.

El entorno debe ser limpio para cada ejecución: perfil de navegador nuevo, cookies eliminadas, sin sesiones personales y con una carpeta independiente para capturas, registros y resultados. Si una página bloquea el acceso, exige una suscripción o cambia su contenido, el agente debe anotarlo; no se debe sustituir silenciosamente por otra fuente.

Qué debe guardar cada agente

La auditoría empieza antes del texto final. Cada ejecución debería conservar:

  • el prompt exacto y la configuración del modelo;
  • la lista ordenada de URLs visitadas, con fecha y hora;
  • las consultas de búsqueda realizadas;
  • capturas o exportaciones del contenido utilizado como evidencia;
  • el registro de acciones del navegador, incluidos errores, bloqueos y reintentos;
  • la versión de la herramienta y del navegador;
  • el artículo final y el recuento de palabras.

Las tres herramientas ofrecen mecanismos distintos para observar el proceso. Browser-use se presenta como un proyecto de agentes que utilizan el navegador y dispone tanto de una implementación pública como de servicios alojados, según su documentación oficial. Agent-browser trabaja con comandos y snapshots de accesibilidad que asignan referencias a los elementos de la página, como @e1 o @e2. Playwright MCP expone herramientas de navegación al modelo mediante snapshots estructurados del árbol de accesibilidad, en lugar de depender necesariamente de capturas visuales. Esas diferencias deben registrarse, no confundirse con una supuesta ventaja editorial.

La rúbrica: no basta con sonar convincente

El resultado debe evaluarse con una plantilla común y, preferiblemente, por una persona que no sepa qué herramienta produjo cada texto. Una puntuación útil puede dividirse en cinco apartados de veinte puntos:

  1. Exactitud: ausencia de datos inventados y representación fiel de las fuentes.
  2. Trazabilidad: cada afirmación relevante enlaza con una fuente concreta.
  3. Calidad de la investigación: diversidad, actualidad y adecuación de las fuentes.
  4. Transparencia: el registro permite reconstruir qué hizo el agente y qué no pudo comprobar.
  5. Calidad editorial: claridad, estructura, longitud solicitada y separación entre hechos e interpretación.

Hay que añadir fallos críticos que anulen la puntuación de un apartado: una cita inexistente, una URL que no respalda la frase, una cifra atribuida a una fuente que no la contiene o una afirmación de navegación que el registro no demuestra. Un texto elegante no debería compensar una cadena de evidencias defectuosa.

Repetir para descubrir si el resultado es estable

Una sola ejecución puede premiar la casualidad. La prueba debería repetirse al menos tres veces por herramienta, manteniendo el encargo y el entorno constantes. Después se comparan no solo las notas medias, sino también la variación: qué fuentes aparecen siempre, qué hechos cambian, cuántas palabras dedica cada sistema al contexto y en qué punto empieza a especular.

El informe final del experimento no debería proclamar un ganador absoluto. Tendría que responder preguntas más concretas: ¿qué herramienta deja el rastro más fácil de revisar?, ¿cuál encuentra fuentes primarias con mayor frecuencia?, ¿cuál reconoce mejor la incertidumbre?, ¿cuál produce el artículo más útil después de una edición humana?

Ese es el límite que conviene medir. Completar una tarea web demuestra que un agente puede actuar. Entregar una investigación breve, enlazada y reconstruible demuestra algo más exigente: que puede trabajar dentro de un proceso editorial donde cada afirmación tiene que rendir cuentas.

Fuentes consultadas