oqoqo – Datos Técnicos
| Título | oqoqo |
|---|---|
| Versión | Actualizaciones continuas, sin numeración pública convencional |
| Desarrollador | oqoqo |
| Tipo | Plataforma de evaluación y benchmarking de agentes de inteligencia artificial |
| Idioma | Inglés |
| Tamaño | Servicio web; no requiere instalación de aplicación de escritorio |
| Licencia | Servicio web con acceso mediante cuenta |
| Compatibilidad | Navegadores web modernos, CLI y MCP |
| Funciones principales | Evaluación de agentes, benchmarks personalizados, experimentos reproducibles, rúbricas, análisis de trayectorias y métricas de rendimiento |
| Interfaces | Aplicación web, CLI y MCP |
Introducción
oqoqo es una plataforma de evaluación de agentes de IA diseñada para probar tareas reales en entornos controlados. Permite crear evaluaciones propias, comparar modelos y agentes, medir resultados y detectar obstáculos durante el uso de productos, APIs, herramientas y flujos de trabajo con inteligencia artificial.
Cómo funciona oqoqo para Evaluar Agentes de IA
El proceso comienza con un experimento formado por tareas, agentes, tratamientos y pruebas repetidas. Cada tarea incluye requisitos y una rúbrica. Después, la plataforma ejecuta las distintas combinaciones para comparar el comportamiento bajo las mismas condiciones. Esto permite evaluar, por ejemplo, diferentes modelos, niveles de esfuerzo o configuraciones de herramientas sin depender de una sola ejecución.
Cada prueba se ejecuta en una máquina aislada con el proyecto, archivos, credenciales y herramientas necesarias. El sistema registra la trayectoria completa del agente, incluidos comandos, llamadas a herramientas, errores y resultados. Luego evalúa cada requisito y genera métricas como tasa de éxito, pasos, tokens, duración y fricciones detectadas durante la ejecución.
Generador de Conjuntos de Evaluación Oqoqo para Pruebas de Productos
Algunas Características
- Benchmarks privados: crea conjuntos de tareas propios para medir casos de uso específicos.
- Comparación de agentes: permite enfrentar distintos agentes en las mismas condiciones.
- Evaluación de modelos: facilita comparar modelos dentro de un mismo flujo experimental.
- Tratamientos configurables: prueba distintas combinaciones de MCP, skills, CLI y SDK.
- Entornos aislados: cada ensayo comienza en un entorno independiente para reducir contaminación entre pruebas.
- Trayectorias completas: conserva el recorrido seguido por el agente durante cada tarea.
- Rúbricas personalizadas: define qué condiciones debe cumplir una tarea para considerarse correcta.
- Análisis de fricciones: identifica obstáculos concretos que dificultan la ejecución.
- Métricas de ejecución: registra tokens, llamadas a herramientas, pasos y duración.
- Integración con CI: permite lanzar evaluaciones cuando un cambio pueda afectar los flujos de trabajo de agentes.
- Repetición de experimentos: ejecuta varias pruebas de una misma combinación para obtener resultados más fiables.
- Acceso por Web, CLI y MCP: ofrece distintas formas de crear o consultar experimentos.
Lo que me encanta de ello
Su mayor valor está en convertir pruebas difíciles de medir en experimentos reproducibles. En lugar de evaluar un agente por una sola interacción, permite observar su comportamiento en varias ejecuciones y relacionar el resultado con los pasos que llevaron al éxito o al fallo.
Novedades de oqoqo
- Nuevos estudios comparativos: se publicaron análisis sobre OpenCode, Claude Code y Pi utilizando la misma configuración de modelo en tareas de programación.
- Mayor atención a las trayectorias: la metodología de evaluación pone el recorrido completo del agente en el centro del análisis.
- Evaluación de productos para agentes: se amplió el enfoque hacia interfaces, APIs, MCP, CLI, SDK y otras superficies utilizadas por agentes.
- Benchmarks personalizados: la plataforma mantiene tareas y rúbricas versionadas para facilitar comparaciones posteriores.
- Ejecución reproducible: cada experimento conserva las condiciones necesarias para relacionar resultados con el entorno utilizado.
- Análisis de fricciones: los problemas encontrados pueden clasificarse por gravedad, recuperación, responsable y evidencia.
- Mayor enfoque en agentes como usuarios: el proyecto continúa investigando cómo los agentes interactúan con productos y herramientas reales.
Requisitos del Sistema
- Plataforma: servicio web en la nube.
- Acceso: navegador web moderno.
- Cuenta: necesaria para utilizar la plataforma.
- Modelos: el usuario puede conectar sus propias claves o suscripciones.
- Agentes compatibles: Claude Code, Codex, Cursor, GitHub Copilot, OpenCode y otros compatibles con la plataforma.
- CLI/MCP: disponibles para determinados flujos de automatización.
Prueba también otros programas de ArtistaPirata:
Conclusión
oqoqo resulta una opción relevante para equipos que necesitan medir el rendimiento de agentes de IA con criterios más cercanos a escenarios reales. Su enfoque facilita convertir pruebas aisladas en evaluaciones estructuradas, algo especialmente útil cuando se comparan diferentes soluciones y se busca obtener resultados consistentes antes de adoptar una tecnología en un proyecto.













