大模型前沿速递

前沿模型基准领先与真实工作能力出现落差

前沿模型基准领先与真实工作能力出现落差

谷歌于2026-10推出Gemini 4 Argon并宣称多项基准、长上下文和网络安全能力领先,但DeepSWE等编程成绩受到测试条件、匿名内部反馈和可能刷榜质疑。后续应以独立复现、真实代码任务、失败率、稳定性、开放范围、安全边界和单位成功任务成本检验宣传结论;PatternEval的2415题结果也提示thinking与non-thinking模式存在表达失配和思维链泄漏风险。

Sources (2)
Updated Oct 1, 2026