Dashboard

Es ist 2:14 Uhr nachts, und der Checkout fällt aus. Um 2:15 läuft die Untersuchung.

Auf die Warteliste

Ein Alert feuert. Polylane nimmt ihn auf. Echt oder Rauschen: in unter einer Minute beantwortet.

Issues Elevated error rate on payments-api Timeline

Elevated error rate on payments-api

High Incident ·Detected from a Datadog alert
OverviewMetricsLogsTracesTimelinePropertiesInvestigation
  1. 02:14:07 Alert received

    Datadog · payments-api error rate · occurrence #1

  2. 02:14:09 Triage started

    Fetching the monitor query and metrics 30 min before, 5 min after the firing.

  3. 02:14:58 Triaged as an incident

    Severity high. Error rate 41× the 30-minute baseline, clustered on POST /v1/charges; deploy f3a9c12 landed 18 minutes before the firing.

  4. 02:15:02 Investigation started

    3 hypotheses · 3 passes each

  5. 02:31:44 Alert fired again (occurrence #2)

    Folded into this issue after 16 quiet minutes; the running investigation was nudged.

  6. 03:06:12 Alert recovered

    Provider recovery received. Issue resolved.

Es gräbt, bis es beweisen kann. Hypothesen von beiden Seiten verhandelt, Urteile, die Belege brauchen.

Threads Critical latency degradation in checkout-edge worker Share

What I did

I queued an autofix that restores the Hyperdrive pool hd-prod in the coreplane/checkout-edge repo with:

  • max_connections restored from 5 to 50 on the pool binding
  • a regression test that fails when checkout queues on the pool
  • wrangler.jsonc configured to deploy as checkout-edge

This gives Boris a PR with deployable code. Once merged, running wrangler deploy will replace the degraded worker with the fixed version.

The root cause report has been updated with the occurrence #2 evidence: Root Cause: checkout-edge Latency Degradation (Recurring).

Wall Time
checkout-edge worker · last hour
Export chart
Wall Time P99
28,381ms
Wall Time P95
2,696ms
Wall Time P50
118ms
010k20k30k
18:0018:2519:00
Worked for 4m 12s

AI can make mistakes. Please double check cited sources.

Dig deeper...

Der Incident endet mit einem Fix, nicht mit einem Folgemeeting. Grundursache gefunden, Fix geschrieben, bereit für dein Review.

github.com/coreplane/payments-api/pull/491

Cap retries on the checkout webhook worker #491

polylane
Open polylane wants to merge 1 commit into main from polylane/autofix/chat/k3x9f2-4e7d21a
Conversation 1 Commits 1 Checks 1 Files changed 2
polylane bot commented 6 minutes ago ···

Retries on the checkout webhook worker were unbounded: a failing delivery re-queued itself forever and amplified load on payments-api. This caps delivery at 5 attempts with exponential backoff and dead-letters the payload after the last one.

What changed

worker/deliver.ts gains MAX_DELIVERY_ATTEMPTS = 5 and backoff between attempts; exhausted payloads land in checkout-webhooks-dlq instead of re-queueing.

Validation

npm test — 214 passed. A forced failing delivery stopped after 5 attempts and appeared in the dead-letter queue.

Root cause · Why it's safe · Out of scope
polylane added commit 4e7d21a Verified
Review required At least 1 approving review is required
ci / test Successful in 3m 12s Details
Review required Waiting on your review: Polylane never merges on its own
Merging is blocked

So funktioniert Polylane. Es lernt dein System, beobachtet es, untersucht und handelt.

  • Es lernt zuerst dein System

    Der Context Graph kartiert jede Ressource und Abhängigkeit über deine Clouds, Repos und Observability-Provider. Agenten denken über echte Topologie nach, nicht über Vermutungen.

  • Erkennung ohne Schwellenwerte

    Eingebaute Checks für jeden Provider, plus Checks aus deinen eigenen gespeicherten Queries und Dashboards. Ein statistischer Durchgang und ein Agent entscheiden gemeinsam, und eine Verbesserung löst nie ein Issue aus.

  • Untersuchungen mit Belegen

    Jede Behauptung verweist zurück auf die Query, die Logzeile oder den Änderungseintrag dahinter. Ein Urteil ohne Belege fällt auf unentschieden zurück.

  • Schreibzugriff wird verdient, nie vorausgesetzt

    Konten verbinden sich nur lesend. Rollbacks sind standardmäßig aus, ratenbegrenzt und protokolliert. Codeänderungen gehen durch dein normales Review.

  • Es wird jede Woche schärfer

    Memories, tägliche Notizen und Monitoring-Queries, gegen echte Daten neu bestätigt: Die Untersuchung im Juli lernt von der im Juni.

Es steckt sich in das, was du schon betreibst. Nur lesend verbinden und loslegen.

Fragen.

Weckt mich Polylane?

Es ist kein Pager und versucht auch nicht, einer zu sein. Polylane benachrichtigt per E-Mail, Slack und Konsole, und nur bei kritischen und hohen Issues, die es selbst erkannt hat. Das Ziel sind weniger Weckrufe: Das Issue kommt bereits untersucht an.

Was passiert, wenn nachts ein Issue erkannt wird?

Die Triage bestätigt, dass es echt ist, eine Untersuchung startet von selbst, und Hypothesen werden parallel gegen deine echte Telemetrie getestet. Am Morgen hat das Issue ein Urteil, die Belege dahinter und vorgeschlagene nächste Schritte; wo Autofix aktiviert ist, ist der Fix schon geschrieben und wartet auf Review.

Welche Alert-Quellen nimmt Polylane auf?

Datadog, Honeycomb, Axiom, Grafana Cloud, Better Stack, Sentry, CloudWatch, Vercel, Render und Cloudflare, plus ein generischer Webhook für alles andere. Jede Quelle authentifiziert sich mit einem gescopten Telemetrie-Token, und jedes Feuern wird zu einem triagierten Issue.

Was, wenn Polylane einen echten Incident als Rauschen einstuft?

„Kein Incident“ ist ein Urteil, keine Löschung: Das Issue bleibt mit der Begründung in der Konsole, und du kannst bei allem mit einem Klick eine Untersuchung starten. Urteile brauchen Belege, und eine Untersuchung, die keine Daten erreichen konnte, bestätigt nie.

Wie viele Untersuchungen wird es starten?

Automatische Untersuchungen sind pro rollierende 24 Stunden begrenzt: 10 im Free-Plan, deine eigene Obergrenze in bezahlten Plänen. Manuelle Starts zählen nie dagegen. Die Preise sind öffentlich unter polylane.com/pricing.

Weitere Anwendungsfälle

Gib die Nächte an die Agenten. Behalte die Morgen.