OpenAI Releases Framework for Trustworthy AI Evaluations, Warns Flawed Testing Methods Can Dramatically Skew Results
OpenAI releases a framework warning that flawed AI testing methods can dramatically skew results, revealing that harness changes alone can cut a model's performance score nearly in half, while calling for full transparency in third-party evaluations.