Founding Researcher
기회
이제 코드의 대부분은 코딩 에이전트가 씁니다. 병목은 타이핑에서 그 주변의 모든 것으로 옮겨 갔습니다. 관측하고, 모니터링하고, 디버깅하고, 근본 원인을 찾고, 온콜을 서고, 무엇을 출시해도 안전한지 결정하는 일. 라이프사이클은 두 반쪽으로 접히고 있습니다. 한쪽은 의도, 다른 쪽은 실행입니다. 실행 쪽이 이렇게 어려워서는 안 됩니다.
저희는 Polylane을 만들고 있습니다. 개발자가 스스로 운영되는 소프트웨어를 출시할 수 있게 하는 플랫폼입니다. 프로덕션에서 스스로를 지켜보고, 이슈를 조사하고, 근본 원인을 찾고, 누가 호출을 받기 전에 수정을 출시하는 소프트웨어. 스스로 운영되는 소프트웨어.
에이전트를 신뢰할 수 없다면 그중 어떤 것도 동작하지 않습니다. 이 역할의 목표는 스스로 운영되는 소프트웨어 뒤의 모델과 하네스를 개선하는 것입니다. 어려운 문제는 모델이 수정을 제안하게 하는 것이 아닙니다. 에이전트가 언제 맞고, 언제 추측하고 있는지, 그리고 그 경계를 실행마다 어떻게 옮길지를 경험적으로 아는 것입니다. 이것은 프로덕션에서의 연구입니다. 여러분의 실험은 실제 워크스페이스에 출시되고, 피드백 루프는 학회 주기가 아니라 일 단위로 측정됩니다.
하게 될 일
- 모델 자체를 개선합니다. 실제 운영 데이터로 포스트 트레이닝하여 실행마다 프로덕션 시스템을 더 잘 조사하게 합니다.
- 하네스를 개선합니다. 에이전트 루프, 도구, 컨텍스트를 개선해 같은 모델이 같은 인시던트에서 더 멀리 가게 합니다.
- 실제 프로덕션 인시던트의 정답에 비추어 에이전트 조사를 점수화하는 평가 하네스를 만듭니다.
- 컨텍스트 엔지니어링 실험을 진행합니다. 브리핑, 메모리, 검색 전반에서 무엇을, 언제, 얼마나 주입할지.
- 장기 운영 작업에서 도구를 쓰는 에이전트의 실패 모드를 연구하고 수정으로 바꿉니다.
- 내부에 발표하고, 저희를 더 예리하게 만든다면 외부에도 발표합니다.
찾는 사람
LLM 시스템을 출시하고 데모나 느낌을 넘어 진지하게 측정해 본 경험이 있어야 합니다. 평가 방법론에 유창합니다. 데이터셋 구축, 메트릭 정의, 오염 방지.
TypeScript나 Python으로 프로덕션 수준의 코드를 쓰고, 출시하는 데 리서치 엔지니어가 필요하지 않습니다. 에이전트 신뢰성, 그라운딩, 컨텍스트 윈도우에 대해 실험으로 뒷받침되는 의견이 있습니다.
답이 “아직 모른다”일 때 불편해하지 않고, 알아내는 데 엄격합니다.
Coreplane Labs는 누구인가요?
작은 팀이고, Polylane을 만드는 회사입니다. 저희는 Cloudflare 규모에서 운영해 왔고, 그곳에서 매일 수백만 명의 개발자가 쓰는 관측성 플랫폼을 만들었습니다. 프로덕션 시스템을 쓰고, 운영하고, 고장 내는 일을 직업으로 여러 해를 보냈습니다.
Coreplane은 그다음에 오는 것입니다. 샌프란시스코에 있습니다. 대면으로 일합니다.