Introducing FrontierCode
kept by eddie
Cognition's FrontierCode benchmark measures code mergeability, finding even top models like Claude Opus 4.8 score only 13.4% on its hardest 50 tasks.
One line. Many voicesSeek and you shall find
kept by eddie
Cognition's FrontierCode benchmark measures code mergeability, finding even top models like Claude Opus 4.8 score only 13.4% on its hardest 50 tasks.