ダッシュボード
すべての役割

Founding Researcher

San Francisco, CA フルタイム、対面 $200kから$400k + 十分なストックオプション

機会

今ではコードの大半をコーディングエージェントが書きます。ボトルネックはタイピングから、その周辺のすべてに移りました。観測、監視、デバッグ、根本原因の特定、オンコール、何を出荷しても安全かの判断です。ライフサイクルは2つの半分に折りたたまれつつあります。一方は意図、もう一方は実行です。実行の半分は、これほど難しくあるべきではありません。

私たちはPolylaneを作っています。開発者が自律運用するソフトウェアを出荷できるようにするプラットフォームです。本番環境で自らを見守り、イシューを調査し、根本原因を見つけ、誰かが呼び出される前に修正を出荷するソフトウェア。自らを運用するソフトウェアです。

そのどれも、エージェントが信頼できなければ機能しません。この役割の目標は、自律運用するソフトウェアの背後にあるモデルとハーネスを改善することです。難しいのはモデルに修正を提案させることではありません。エージェントがいつ正しく、いつ推測していて、その境界を実行のたびにどう動かすかを、経験的に知ることです。これは本番環境における研究です。実験は実際のワークスペースに出荷され、フィードバックループは学会のサイクルではなく日単位で測られます。

取り組むこと

  • モデル自体を改善する。実際の運用データでポストトレーニングし、実行のたびに本番システムの調査が上達するようにする。
  • ハーネスを改善する。エージェントのループ、ツール、コンテキストを改善し、同じモデルが同じインシデントでより遠くまで到達できるようにする。
  • 実際の本番インシデントの正解データに対してエージェントの調査を採点する評価ハーネスを作る。
  • コンテキストエンジニアリングの実験を行う。ブリーフィング、メモリー、検索にわたって、何を、いつ、どれだけ注入するか。
  • 長期の運用タスクにおけるツール使用エージェントの失敗モードを研究し、修正に変える。
  • 社内で発表し、私たちをより鋭くしてくれるなら社外でも発表する。

求める人

LLMシステムを出荷し、デモや雰囲気を超えて真剣に測定した経験のある人です。評価の方法論に精通しています。データセットの構築、メトリクスの定義、コンタミネーションの回避です。

TypeScriptまたはPythonで本番品質のコードを書き、出荷のためにリサーチエンジニアを必要としません。エージェントの信頼性、グラウンディング、コンテキストウィンドウについて、実験に裏付けられた意見を持っています。

答えが「まだ分からない」であることに落ち着いて向き合い、それを突き止めることに厳密です。

Coreplane Labsとは

小さなチームで、Polylaneの背後にいる会社です。私たちはCloudflareの規模で運用し、そこで毎日数百万人の開発者が使うオブザーバビリティプラットフォームを作りました。本番システムを書き、運用し、壊すことを生業として何年も過ごしてきました。

Coreplaneはその次に来るものです。サンフランシスコを拠点に、対面で働いています。

応募

履歴書は不要です。以下に情報を入力するか、Xで @boristane にDMを送ってください。