Dashboard

Dziesięć wdrożeń dziennie. Jedno z nich jest złe. Polylane je znajduje i cofa.

Dołącz do listy oczekujących

Każde wdrożenie obserwowane, od razu. Co się zmieniło, kto to zmienił i sygnały najbardziej narażone na awarię.

Clouds prod-aws Changes

SQS visibility timeout lowered on checkout-events

Moderate impact configuration ·Synced 12 minutes ago

VisibilityTimeout on checkout-events dropped from 120s to 15s. Consumers that hold a message longer than 15 seconds will see it delivered twice; the dead-letter queue threshold is unchanged.

What we're watching
ApproximateAgeOfOldestMessage
checkout-events · baseline at change 3.2s · worse if up
Watching: no issue since this change
NumberOfMessagesReceived
checkout-events · baseline at change 41/min · worse if up
Watching: no issue since this change
Triggering events
SetQueueAttributes CloudTrail · deploy-bot · 12:41:02Z attached to this record's delta window
Full diff (3 changes)
Nodes (2) Edges (1)
2 nodes modified · 1 edge removed

Rollback, jeśli go chcesz. Domyślnie wyłączony. Włącz go, a resztą zajmie się agent.

Issues Critical latency degradation in checkout-edge worker Overview

Critical latency degradation in checkout-edge worker

Incident critical Polylane ·Detected 3 hours ago ·Last seen 4 minutes ago ·2 occurrences
OverviewInvestigationMetricsTimelineProperties
checkout-edge Cloudflare Worker

Critical latency degradation detected in checkout-edge worker: 18x+ P99 latency spikes sustained for 12 minutes

Causal metrics All metrics
Request Duration
414 ms ▲ 43.1σ
Wall Time
416 ms ▲ 43.0σ
CPU Time
14 ms ▲ 2.6σ
Blast radius
Search your cloud resources...
Graph Table
edge-gateway Cloudflare Worker ··· checkout-edge Cloudflare Worker ··· hd-prod Hyperdrive ··· payments-db PlanetScale ··· cart-svc Cloudflare Worker ···
Analysis Copy

Deploy 9f3c2a1 shrank the Hyperdrive pool hd-prod from 50 connections to 5. Under checkout load, requests queue on connection checkout and P99 rises 18× against the 30-minute baseline. Restoring the pool size restores latency.

Tags
service · checkout-edgeprovider · cloudflaredeploy · 9f3c2a1signal · wall_time_p99

Cofnij teraz. Napraw porządnie potem. Rollback kupuje czas: prawdziwa poprawka trafia do twojego przeglądu.

github.com/coreplane/payments-api/pull/491

Cap retries on the checkout webhook worker #491

polylane
Open polylane wants to merge 1 commit into main from polylane/autofix/chat/k3x9f2-4e7d21a
Conversation 1 Commits 1 Checks 1 Files changed 2
polylane bot commented 6 minutes ago ···

Retries on the checkout webhook worker were unbounded: a failing delivery re-queued itself forever and amplified load on payments-api. This caps delivery at 5 attempts with exponential backoff and dead-letters the payload after the last one.

What changed

worker/deliver.ts gains MAX_DELIVERY_ATTEMPTS = 5 and backoff between attempts; exhausted payloads land in checkout-webhooks-dlq instead of re-queueing.

Validation

npm test — 214 passed. A forced failing delivery stopped after 5 attempts and appeared in the dead-letter queue.

Root cause · Why it's safe · Out of scope
polylane added commit 4e7d21a Verified
Review required At least 1 approving review is required
ci / test Successful in 3m 12s Details
Review required Waiting on your review: Polylane never merges on its own
Merging is blocked

Jak działa Polylane. Poznaje twój system, obserwuje go, bada i działa.

  • Najpierw poznaje twój system

    Graf kontekstu mapuje każdy zasób i zależność w twoich chmurach, repozytoriach i u dostawców obserwowalności. Agenci rozumują nad prawdziwą topologią, nie domysłami.

  • Wykrywanie bez progów

    Wbudowane kontrole dla każdego dostawcy, plus kontrole generowane z twoich zapisanych zapytań i dashboardów. Przebieg statystyczny i agent decydują razem, a poprawa nigdy nie otwiera problemu.

  • Dochodzenia, które pokazują dowody

    Każde twierdzenie prowadzi do zapytania, wiersza logu lub rekordu zmiany, który za nim stoi. Werdykt bez dowodów spada do nierozstrzygniętego.

  • Na zapis trzeba zasłużyć, nigdy nie jest zakładany

    Konta łączą się w trybie tylko do odczytu. Rollbacki są domyślnie wyłączone, z limitem częstości i w rejestrze. Zmiany w kodzie przechodzą przez twój zwykły przegląd.

  • Co tydzień jest ostrzejsze

    Wspomnienia, dzienne notatki i zapytania monitoringu ponownie potwierdzane na prawdziwych danych: lipcowe dochodzenie uczy się od czerwcowego.

Wpina się w to, co już uruchamiasz. Połącz w trybie tylko do odczytu i zacznij.

Pytania.

Na których platformach Polylane potrafi zrobić rollback?

Wdrożenia w Cloudflare, Vercel, Render i Fly.io, z przywróceniem ostatniego znanego dobrego wdrożenia. Rollbacki są domyślnie wyłączone: włączasz je samodzielnie i możesz wyłączyć w każdej chwili.

Co zatrzymuje pętlę automatycznych rollbacków?

Twarde limity w platformie, nie ocena agenta. Trzy udane rollbacki na godzinę na cel, jeden rollback w toku naraz, a gdy równoległe przebiegi nie zgadzają się co do wersji do przywrócenia, akcja jest blokowana i eskalowana do ciebie.

Czy potrzebuje mojego pipeline CI?

Nie. Polylane czyta wdrożenia od samych dostawców. Przegląd pull request działa jako check w GitHub, którego możesz wymagać, ale nic w twoim pipeline się nie zmienia.

A co ze zmianami, które nie są wdrożeniami?

Edycje konfiguracji, zdarzenia skalowania i zmiany bezpieczeństwa są zapisywane i obserwowane tak samo. Gdy kolejka zaczyna się źle zachowywać dwanaście minut po tym, jak ktoś obniżył jej visibility timeout, dochodzenie zaczyna od tej zmiany.

Czy mogę zobaczyć, dlaczego doszło do rollbacku?

Każdy rollback ma dowody: przebieg, który go wykonał, sygnały, które się cofnęły, przywrócona wersja i rozumowanie trafiają do rejestru.

Więcej przypadków użycia

Scalaj w piątek. Polylane ma weekend.