9月1日,Anthropic甩出Fable 5.1,直接把科学推理基准成绩从24.7%拉到52.6%——翻了一倍多。这不是小版本迭代,这是断层式碾压。

隔壁GPT-5.6 Sol在这项测试里只有22.4...