Aug 30, 2026
auto-empirical-research-skills:带基准测试的 1,096 个计量研究 skill
一份 3.6k 星的 Stanford REAP × CoPaper.AI 合集,把实证研究方法——从数据清洗到期刊投稿——打包成 agent skill,并用 19 个基准任务和公开评分器检验你的 agent 是否真的跑对了。
让编码 agent "跑个双重差分",它会兴致勃勃地产出一份看起来像计量经济学的结果——聚类可能错了、对照组建错了、标准误的含义可能根本不是它声称的那样。brycewang-stanford/Auto-Empirical-Research-Skills(AERS,3.6k 星)是 Stanford REAP × CoPaper.AI 出品的合集,把实证研究方法打包成 agent skill——而且在这个生态里少见地附带了检验 agent 是否跑对的基准评测。
为什么这个 Skill 重要
目录规模很大——项目的 skill 搜索页统计有 1,096 个 skill、76 个合集,覆盖 README 所描述的从数据清洗到顶刊投稿的完整工作流。把它和 prompt 大杂烩区分开的是信任面:19 个数值基准任务,每次运行都用真实数据重算标准答案;外加 42 个行为评测场景、217 条评分细则——42 个场景里有 9 个已被证明能区分 agent 的对错行为。仓库甚至邀请你用 aers-score 给自己的 agent 打分,并把用同一评分器重算的成绩发布在外部排行榜上。
skill 明显偏计量经济学:README 上的示例提示词要求在面板数据上跑 Callaway–Sant'Anna 事件研究,附 HonestDiD 稳健性检验和期刊级表格。专门的插件覆盖 Python、Stata 和 R + Quarto 三条流水线。
安装
README 里最快的路径是把仓库 URL 丢给 agent,说清楚装到哪:
帮我安装 https://github.com/brycewang-stanford/Auto-Empirical-Research-Skills
装到全局,所有项目都能用
作用域对应目录:当前文件夹(.claude/skills/)、可提交进 git 的共享项目、或全局(~/.claude/skills/,Codex 是 ~/.codex/skills/)。Claude Code v2.1+ 走插件市场更方便升级:
claude plugin marketplace add brycewang-stanford/Auto-Empirical-Research-Skills
claude plugin install aer-skills@auto-empirical-research-skills
aer-skills 是完整的顶刊投稿工作流(9 个 skill);只要单条流水线就换装 empirical-analysis-python、empirical-analysis-stata 或 empirical-analysis-r。只想要某一个 skill,就 --recurse-submodules 克隆后拷文件夹——README 特别提醒部分合集的 SKILL.md 在下一层,拷有它的那一层。
实战:一次经得起审稿的事件研究
- 装上 Python 分析插件,新开会话,把面板数据集放在工作目录。
- 自然语言提示——agent 按 description 自动挑 skill:
用面板数据跑一个 Callaway–Sant'Anna 事件研究,并出 HonestDiD 稳健性和期刊级表格
- 对照基准纪律检查输出:这些 skill 被设计成把估计、稳健性检验、表格排版拆成各自可验证的步骤,而不是一团黑箱脚本。
想知道你的 agent 是否真的按方法执行,跑项目自己的评测:pip install -e . 装上 aers-score,它会对照基准任务给 agent 打分,并打印哪里出了错。
技巧
- 文档以中文为默认;英文、繁体中文、日文、韩文版本都在仓库里。
make quickstart在终端打印五分钟的目录导览。- 许可是 CC BY-SA 4.0——和这个生态常见的 MIT/Apache 不同,二次分发前先看清署名条款。
- 拷贝的 skill 没反应时,先确认拷进去的目录里真的有
SKILL.md——README 点名的常见故障就是这个。
何时不用这个 Skill
深度集中在实证经济学和统计工作流;如果你的研究是湿实验室生物或定性田野调查,覆盖会很薄。规模也是双刃剑——把 76 个合集全装进一个 agent,正是 skill 作者们警告的上下文膨胀,按需装自己用的流水线就好。
查看 排行榜 了解更多 skill。