Vibe Coding-远程-1个月
¥18-30K/月
技能要求: Ruby,Python,TypeScript
经验要求: 5-10年经验
程序员客栈
2026-09-15 10:33
工作描述:
项目编号:【44326】
招聘:AI 编程 Agent 评测任务设计(兼职 / 远程)

关于这份工作

我们在做 AI 编程 agent 的能力评测。简单说:你在真实的开源代码库里,像一个正常工程师那样给 AI agent 派活儿,观察它在哪里出错,然后把这个"出错场景"整理成一套可复现、可打分的评测任务。

这不是标注工作,更接近用工程判断力去找 AI的盲区——需要你真的看得懂代码、判断得出一个错误在真实团队里意味着什么。

你需要做的

熟悉一个指定的开源项目(Web 应用为主,以 Ruby 后端居多)
设计真实工程师会提的需求:加功能、修 bug、排查线上问题等让 AI agent 去完成,观察并验证它犯的错误是否"有实际后果"(比如埋了安全漏洞、功能没做完、诊断错了、声称验证过但其实没验)
把这个场景固化成标准任务:写清楚需求、还原起始环境、写评分标准
跑多轮验证、整理证据、提交并根据反馈迭代

我们会提供一整套 toolkit,代码库、开发环境、跑任务、自动评分、打包提交全部已经脚本化,一条命令搞定。你不需要自己搭环境或写基础设施,注意力可以全部放在"设计任务 + 判断 agent 的输出好不好"上。上手有文档和示例任务,我也会带你走通第一个。

我们希望你

3 年以上软件开发经验,有能力独立读懂一个中等规模的陌生代码库
Ruby / Rails 优先(目前的代码库大多是 Ruby 后端),Python、TypeScript 也可以
熟悉命令行、Git、Docker
有 Claude 的使用权限(Claude Code / 订阅账号均可)。
细心、能把事情写清楚——很大一部分工作是"把判断写成别人也能照着执行的标准"
英文基础读写即可:过程中 agent 和工具会输出英文,能看懂大意就行,看不懂用翻译软件也完全够用

加分项

有 code review、写测试、做技术方案评审的经验
对 AI evaluation / benchmark 有兴趣或了解

合作方式

兼职、远程、时间灵活
交付物用中文即可
按小时或按任务结算,具体面议
需要一台能跑 Docker 的开发机
项目材料需严格保密

联系方式

有兴趣请发简历 + 简单说明你最熟悉的技术栈,以及你用 coding agent 的经历。
公司信息

立即沟通