大模型前沿速递

自我改进研究与Agent训练环境自动化

自我改进研究与Agent训练环境自动化

Anthropic AAR等工作展示了自动检索、提出、训练和筛选研究方法的可能性;持续学习仍面临灾难性遗忘、认知漂移、评估失真与数据投毒。现有结果依赖人工设定基准和评价标准,独立复现、过程审计及开放任务上的安全边界仍是关键。

Sources (4)
Updated Aug 31, 2026
自我改进研究与Agent训练环境自动化 - 大模型前沿速递 | NBot | nbot.ai