Amazoni ülemaailmne pilveteenuse katkestus: ajajoon, põhjus ja ulatus

  • Globaalne AWS-intsident, mille epitsenter asub US-EAST-1 piirkonnas ja mis algas umbes kell 9.00 (poolsaare aja järgi)
  • Amazon tuvastas DynamoDB-s allika ja selle aluseks oleva DNS-probleemi ning keskpäevaks oli olukord järk-järgult taastumas.
  • Mõju mitmele teenusele: Alexa, Prime Video, Canva, Duolingo, Snapchat ja videomängud nagu Fortnite ja Roblox
  • Konkreetsed mõjud jätkusid pärastlõunal, samal ajal kui rakendati leevendusmeetmeid.

Üldine pilt globaalsest AWS-i katkestusest

Laialdane Amazon Web Services'i (AWS) infrastruktuuri mõjutav katkestus on aeg-ajalt häirinud tuhandete platvormide ja rakenduste teenust erinevates riikides. Kasutajate teated ühenduvusprobleemidest, latentsusprobleemidest ja ebaõnnestunud laadimistest kasvasid täna varahommikul järsult , eriti suure kontsentratsiooniga Ameerika Ühendriikides ja nähtavate mõjudega Euroopas.

Ettevõtte olekupaneeli kohaselt sai probleem alguse USA -EAST-1 piirkonnast (Põhja-Virginia) ja põhjustas mitme API veamäära ebatavalise hüppe. Keskhommikuks teatas AWS selgetest taastumise märkidest arvukates teenustes, kuigi meeskonnad töötasid endiselt probleemi täieliku lahendamise ja kogu tegevuse normaalseks taastamise nimel.

Juhtumi kronoloogia

Esimesed hoiatused saabusid umbes kell 9.00 hommikul (Hispaania poolsaare aja järgi) ning varsti pärast seda saavutati intsidentide haripunkt ning jälgimisvahenditesse, näiteks DownDetectorisse, ilmusid pidevad teated. Alates kella 11.00-st teatas ettevõte võimaliku põhjuse tuvastamisest ja leevendusmeetmete rakendamisest, mis kiirendasid taastumist eri kihtides.

Keskpäeva paiku teatas AWS, et enamik tegevusi normaliseerub , kuigi märgati mõjutatud piirkonnas teatud taotluste ja teenuste osas aeg-ajalt piiranguid. Varasel pärastlõunal oli stabiliseerimispüüdluste jätkudes endiselt tunda jääkmõjusid .

Illustratsioon Amazoni pilve probleemidest

Kus oli tehniline päritolu?

Ettevõte keskendus Amazon DynamoDB-le , oma hallatavale võtme-väärtuse andmebaasiteenusele, mille US-EAST-1 piirkonnas asuvas lõpp-punktis esines tõrkeid, mis põhjustasid kaskaadseid vigu mitmes sõltuvuses. AWS viitas päästikule DNS-probleemile , millega tegeleti etapiviisiliselt.

Praktikas juhtub nii, et kui domeeninimesüsteem (DNS) ei suuda õigesti lahendada, ei suuda rakendused oma ressursse leida , mille tulemuseks on ühenduse vead, ajalõpud ja andmete laadimise tõrked. Ettevaatusabinõuna soovitas AWS klientidel, kellel on püsivaid probleeme, oma DNS-vahemälu tühjendada , et taastada lahendus õigetesse lõpp-punktidesse.

Keda see on mõjutanud

Mõju oli laialt levinud: Amazon ise teatas probleemidest Alexa ja Prime Videoga , samas kui kolmandate osapoolte teenustel, nagu Canva , Duolingo ja Snapchat, esines probleeme . Katkestusi täheldati ka genereerivate tehisintellekti platvormide ja AWS-pilvel põhinevate koostöörakenduste puhul.

Ka digitaalne meelelahutus ei jäänud puutumata. Suure kasutajaskonnaga mängud ja teenused, nagu Fortnite , Roblox ja Clash Royale , teatasid sisselogimis- või ühenduvusvigadest, samas kui mõned mängupoed ja käivitajad rakendasid leevendusmeetmeid, et mõju vähendada kuni liikluse stabiliseerumiseni.

Mõju Hispaanias

Üle riigi teatasid arvukad kasutajad probleemidest digitaalteenuste rakendustele ja veebisaitidele juurdepääsul, eriti keskhommiku paiku. Mõjutatud oli ka piletiplatvorme , näiteks Ticketmaster, mis lükkas edasi keskpäevaks kavandatud piletite väljalaskmist, sealhulgas kauaoodatud kontsertide piletite müügiletulekut.

Finantsasutused ja suuremad tarbijaplatvormid teatasid oma veebisüsteemides üksikutest intsidentidest , kuigi nende mõju varieerus piirkonniti ja teenuseti. Kuna mõjutatud USA piirkonnas rakendati leevendusmeetmeid, täheldati Euroopas juurdepääsu järkjärgulist taastumist.

Praegune olukord ja soovitused

Tundide möödudes andis AWS märku märkimisväärsetest taastumise märkidest enamiku oma teenuste puhul, säilitades samal ajal teatud toimingutele piirangud US-EAST-1 piirkonnas. Ettevõte jätkab tulemuslikkuse jälgimist ja kohanduste rakendamist probleemi täielikuks lahendamiseks.

Kui teil esineb endiselt üksikuid tõrkeid, on soovitatav kontrollida ametlikku AWS-i olekut ja vajadusel tühjendada DNS-vahemälu või taaskäivitada kliendid ja teenused, mis sõltuvad mõjutatud piirkonnas lõpp-punkti lahendusest. Kriitiliste juurutuste puhul on soovitatav kontrollida ka tõrkesiirdeid , võrgusõltuvusi ja uuesti proovimise poliitikaid, et minimeerida latentsuse ja mööduvate vigade mõju.

See episood toob esile, mil määral on pilvandmetöötluse infrastruktuur muutunud digitaalmajanduse struktuuriliseks osaks: lokaliseeritud rike võtmekeskuses võib kaasa tuua ahelreaktsioone globaalses ulatuses, alates voogedastusest ja videomängudest kuni finants- ja tootlikkusrakendusteni.


Lisa eelistatud allikana Google'is