A OpenAI lançou o GPT-5.5, que superou por pequena margem o Claude Mythos Preview, da Anthropic, no Terminal-Bench 2.0. O resultado foi divulgado em publicação da VentureBeat nesta semana.
O benchmark Terminal-Bench 2.0 é utilizado para avaliar desempenho de modelos de linguagem. Não foram divulgados detalhes adicionais sobre as métricas ou condições do teste.
