Revisiones de evaluaciones de riesgo de desarrolladores de IA
Informes de evaluación
Evaluamos las capacidades autónomas de modelos de IA de frontera, en algunos casos en colaboración con desarrolladores de IA como Anthropic y OpenAI. Lo hacemos tanto para entender las capacidades de los modelos como para probar acuerdos de evaluación por terceros.
Claude Opus 5.5
22 de septiembre de 2026
•
Colaboración
GPT-5.6 Sol
26 de junio de 2026
•
Colaboración
GPT-5.1-Codex-Max
19 de noviembre de 2025
•
Colaboración
GPT-5
7 de agosto de 2025
•
Colaboración
DeepSeek and Qwen
27 de junio de 2025
•
Sin participación de la empresa
OpenAI o3 and o4-mini
16 de abril de 2025
•
Colaboración
Claude 3.7
4 de abril de 2025
•
Colaboración
DeepSeek-R1
5 de marzo de 2025
•
Sin participación de la empresa
GPT-4.5
27 de febrero de 2025
•
Colaboración
DeepSeek-V3
12 de febrero de 2025
•
Sin participación de la empresa
Claude 3.5 Sonnet and o1
31 de enero de 2025
•
Colaboración
Claude 3.5 Sonnet (original)
30 de octubre de 2024
•
Colaboración
o1-preview
12 de septiembre de 2024
•
Colaboración
GPT-4o
7 de agosto de 2024
•
Colaboración
GPT-4 and Claude
17 de marzo de 2023
•
Colaboración
METR no recibe remuneración por este trabajo.
Empresas como OpenAI, Anthropic y xAI han facilitado acceso y tokens, que utilizamos para evaluaciones, investigación e ingeniería. También evaluamos modelos por nuestra cuenta tras su publicación, sin participación de sus desarrolladores. Los informes públicos recientes derivados de este trabajo figuran arriba, y se comentan con mayor detalle en las respectivas system cards.