Founding Researcher
San Francisco, CA 全职,线下办公 $200k至$400k + 可观的股权
机会
如今大部分代码由编程智能体编写。瓶颈已经从敲代码转移到了它周围的一切:观察、监控、调试、定位根因、on-call、判断什么可以安全上线。软件生命周期正在坍缩为两半。一半是意图,另一半是执行。执行这一半不该这么难。
我们在构建Polylane:让开发者交付自我运维软件的平台。这种软件在生产环境中监视自己、调查问题、找出根因,并在有人被叫醒之前发布修复。自己运维自己的软件。
除非智能体值得信任,否则这一切都行不通。这个角色的目标是改进自我运维软件背后的模型和harness。难点不在于让模型提出一个修复方案;而在于凭经验数据知道智能体何时是对的、何时在猜,以及如何一次又一次地推进这条边界。这是在生产环境中做研究:你的实验会上线到真实的工作区,反馈周期以天计,而不是以会议周期计。
你将做什么
- 改进模型本身:在真实运维数据上做后训练,让它们每一次运行都能更好地调查生产系统。
- 改进harness:智能体循环、工具和上下文,让同一个模型在同一次故障上走得更远。
- 构建评估harness,用真实生产故障的基准事实为智能体的调查打分。
- 开展上下文工程实验:在简报、记忆和检索之间,注入什么、何时注入、注入多少。
- 研究使用工具的智能体在长周期运维任务上的失败模式,并把它们变成修复。
- 在内部发表,在能让我们更敏锐时也对外发表。
我们在寻找什么
你应该发布过LLM系统,并认真地度量过它们,而不只是演示和感觉。你精通评估方法论:构建数据集、定义指标、避免污染。
你能用TypeScript或Python写出生产级代码,不需要研究工程师帮你上线。你对智能体的可靠性、接地和上下文窗口有自己的看法,并有实验支撑。
当答案是“我们还不知道”时你能坦然面对,并且严谨地去找出答案。
Coreplane Labs是谁?
一支小团队,也是Polylane背后的公司。我们曾在Cloudflare的规模上运维,在那里构建了每天被数百万开发者使用的可观测性平台。我们以编写、运维和搞坏生产系统为生,做了很多年。
Coreplane是接下来的事。总部在旧金山。我们线下办公。