determine.log
← 学习栏目

学习笔记

Agent 后训练:从失败轨迹到可复现实验

阅读原文 ↗

阅读摘要

原文以工具使用 Agent 的调试与后训练实验展开,涉及请求轨迹记录、SFT、RL、训练资源和奖励分布。作者也指出数据质量与测试规模带来的不确定性;文中效果数字属于其特定实验。 原文

与当前项目的联系

将你的 ReAct Agent 失败案例按工具选择、参数、推理和上下文丢失分类,先建立固定评测集。

面试讨论

为什么先评测再训练?如何隔离训练集与测试集?工具使用提升是否可能伴随其他能力下降?

建议实验

建立一组有明确验收结果的工具任务,保存输入输出、调用参数、错误和耗时;先比较提示修改前后的完成率。

研究延伸

明确一个失败假设,设置对照、重复次数与误差分析;有数据和算力后,再考虑 SFT 或 RL。


摘要用于辅助阅读,原文观点以原文为准。实验与问题是建议练习,不代表 determine 已完成相关工作。

参与讨论 ↓

评论与交流

评论管理 ↗

登录后参与讨论。评论将公开展示,请勿填写隐私信息。回复通知可在评论账号中设置。

评论正在加载…

音乐 / MUSIC

专辑封面

平凡之路

朴树

0:000:00
点击播放试听Apple Music ↗
悬浮 · 可拖动
音量随机试听 · 完整版请使用歌曲入口