sshipanoo/notes
  • 首页
  • 博客
  • 归档
  • 标签

Benchmark

5 articles

  • 2026-07-27 15. 怎样评测一个 Agent,而不是评价最终回答

  • 2026-07-17 17. 代码 Agent 评测方法的设计反思

  • 2026-07-13 13. InterCode:把交互式编程环境变成强化学习的训练场

  • 2026-06-08 21. Benchmark 全景:SWE-bench、AgentBench、τ-bench 怎么读

  • 2026-05-27 项目 28:拒绝虚假繁荣:构建严谨的模型评测(Evaluation Harness)

sshipanoo

你愿意为你喜欢的事情付出多少!

文章

368

类别

6

标签

574

日历
少
多
热门标签
A2A1 ACI1 AI3 AI Agent1 AI SDK1 AI Safety1 AI 协作1 AI入门22 AI写作1 AI搜索1 AI编程1 ALiBi2
最近更新
  • DeepSeek Harness 架构全解:从 Web 请求到 Agent Loop、Trajectory 与本地沙箱

    2026-08-14
  • 00. 导读:从一次抓包进入 Agent 运行时

    2026-07-27
  • 01. 系统提示词是怎样被组装出来的

    2026-07-27
sshipanoo © 2026
RSS · 使用条款 · 本站已运行 天 小时 分
总浏览量 · 总访问量
为了提升本站的使用体验和必要功能的正常使用,本站会使用本地 Cookie。详细请查看« 本站使用条款 »了解更多。