modjor.de

10.3 – Az automatizálásba vetett bizalom és az automatizálás iránti szkepticizmus – Automatisierungsvertrauen und Automatisierungsskepsis


10.3 – Az automatizálásba vetett bizalom és az automatizálás iránti szkepticizmus – Automatisierungsvertrauen und Automatisierungsskepsis


1. A svéd MASAI-vizsgálatban a mammográfiás felvételek nem egyszerűen egy gép által kiadott értékelést kaptak. – In der schwedischen MASAI-Studie wurde eine Mammographie nicht einfach von einer Maschine bewertet.

2. Először egy mesterséges intelligencia-rendszer osztályozta a vizsgálati eredményeket, azokat egy vagy két radiológushoz irányítva, és a gyanús területeket megjelölve, hogy azok figyelmét felhívja rájuk . – Ein System mit künstlicher Intelligenz sortierte die Untersuchung zunächst, leitete sie entweder an einen oder an zwei Radiologen weiter und markierte verdächtige Bereiche, auf die diese besonders achten sollten .

3. A szokásos összehasonlítási módszer a kettős értékelés volt: két radiológus vizsgálta át minden szűrővizsgálati felvételt az automatizált segítség nélkül, amely eljárás célja az volt, hogy minden egyes esethez egy második pár szem is rendelkezésre álljon. – Der übliche Vergleichsmaßstab war die Doppelbefundung: Zwei Radiologen untersuchten jedes Screening-Bild ohne diese automatisierte Hilfe – ein Verfahren, das dafür sorgen sollte, dass für jeden Fall ein zweites Paar Augen zur Verfügung stand.

4. A változás tehát a munkamódszerben történt, nem csupán a szoftverben . – Die Veränderung betraf daher die Arbeitsweise und nicht lediglich die Software .

5. 2021 áprilisa és 2022 decembere között több mint 105 000 nőt osztottak be véletlenszerűen e két szűrővizsgálati eljárás egyikébe, így az összehasonlítás ugyanazon programba bekerült betegeket érintett, nem pedig két egymástól független képgyűjteményt . – Zwischen April 2021 und Dezember 2022 wurden mehr als 105.000 Frauen nach dem Zufallsprinzip einem dieser beiden Screening-Verfahren zugewiesen, sodass der Vergleich Patienten betraf, die am selben Programm teilnahmen, und nicht zwei voneinander unabhängige Bildersammlungen .

6. A véletlenszerű beosztásnak köszönhetően kevésbé volt valószínű, hogy a csoportok közötti különbségek a csoportokba bekerültek összetételét tükrözzék – ez a probléma ugyanis elhomályosíthatja, hogy egy új eljárás valóban megváltoztatta-e az eredményt . – Durch die zufällige Zuordnung war es weniger wahrscheinlich, dass Unterschiede zwischen den Gruppen darauf zurückzuführen waren, wer ihnen zugeordnet wurde – ein Problem, das verschleiern kann, ob ein neues Verfahren das Ergebnis tatsächlich verändert hat .

7. Mindkét csoport továbbra is emberi értékelőkre támaszkodott, és mindkettőnél előfordulhatott, hogy rákot nem észleltek . – Beide Gruppen waren weiterhin auf menschliche Befunder angewiesen, und in beiden konnten Krebsfälle übersehen werden .

8. A kérdés az volt, hogy az értékelő figyelmének átirányítása és a kiválasztott vizsgálatoknál az értékelések számának csökkentése megőrzi-e vagy javítja-e a szűrővizsgálati szolgáltatást egészében . – Die Frage war, ob die Umlenkung der Aufmerksamkeit eines Befunders und die Verringerung der Anzahl der Befundungen bei ausgewählten Untersuchungen den Screening-Service insgesamt erhalten oder verbessern würde .

9. Ez egy élesebb kérdés, mint az, hogy egy számítógép képes-e felismerni egy képet . – Das ist eine pointiertere Frage als die, ob ein Computer ein Bild erkennen kann.

10. Arra keresi a választ, hogy mikor támaszkodhatnak az emberek ésszerűen egy adott munkamegosztásra egy adott feladat esetében, olyan következményekkel, amelyek az első értékelés után is láthatóak maradnak . – Sie fragt danach, wann Menschen sich bei einer bestimmten Aufgabe vernünftigerweise auf eine bestimmte Arbeitsteilung verlassen können, deren Folgen auch nach der ersten Befundung noch sichtbar bleiben.

11. Egy korai elemzés megállapította, hogy a mesterséges intelligenciával támogatott eljárás körülbelül 44 százalékkal csökkentette a radiológusok által végzett értékelések számát . – Eine frühe Analyse ergab, dass das KI-gestützte Verfahren die Anzahl der radiologischen Befundungen um etwa 44 Prozent reduzierte.

12. Ezek értékelések voltak, nem pedig a szűrés alól mentesített nők vagy a helyettesített radiológusok száma. – Dabei handelte es sich um Befundungen, nicht um Frauen, denen die Vorsorgeuntersuchung erspart blieb, oder um Radiologen, die ersetzt wurden.

13. A különbség azért fontos, mert a rendszer részben úgy takarított meg munkaerőt, hogy eldöntötte, mely képeket vizsgáljon meg egy ember, és melyeket továbbra is kettő, így maga a figyelem elosztása is a beavatkozás részévé vált. – Der Unterschied ist von Bedeutung, da das System Arbeitsaufwand teilweise dadurch einsparte, dass es entschied, welche Bilder eine menschliche Befundung erhielten und welche weiterhin zwei – wodurch die Zuweisung der Aufmerksamkeit selbst Teil der Intervention wurde.

14. Ha a szortírozási szabály figyelmen kívül hagyott egy nehéz esetet, a látszólagos hatékonyságnövekedés egyúttal el is vehette a második esélyt annak felismerésére . – Wenn die Sortierregel einen schwierigen Fall übersah, könnte der scheinbare Effizienzgewinn auch eine zweite Chance zunichte machen, diesen Fall zu erkennen .

15. A vizsgálatnak ezért olyan eredményre volt szüksége, amely túlmutat a megtakarított perceken vagy a képeken feltüntetett jelöléseken. – Die Studie benötigte daher ein Ergebnis, das über eingesparte Minuten oder Markierungen auf Bildern hinausging.

16. Az intervallumrákot a szűrővizsgálati ciklusok között, vagy az utolsó tervezett ciklus után két éven belül diagnosztizálják, miután a szűrővizsgálat során nem találták meg; ezeknek az eseteknek a számbavétele összehasonlítja a megnyugtató negatív eredményt a későbbi klinikai valósággal . – Ein Intervallkarzinom wird zwischen zwei Vorsorgeuntersuchungen oder innerhalb von zwei Jahren nach der letzten planmäßigen Untersuchung diagnostiziert, nachdem es bei der Vorsorgeuntersuchung nicht festgestellt wurde; die Zählung dieser Fälle vergleicht das beruhigende negative Ergebnis mit der späteren klinischen Realität.

17. Ez egy tökéletlen, de következményes módszert kínál arra, hogy megkérdezzük: mit hagyott ki a szűrővizsgálati folyamat? – Dies bietet eine zwar unvollkommene, aber aussagekräftige Möglichkeit, zu ergründen, was der Vorsorgeprozess übersehen hat.

18. A 2026-ban közzétett eredmények szerint az intervallumrákok előfordulási aránya az AI-támogatott csoportban 1,55/1000 nő, a standard csoportban pedig 1,76/1000 volt. – In den 2026 veröffentlichten Ergebnissen traten Intervallkarzinome mit einer Rate von 1,55 pro 1.000 Frauen in der KI-gestützten Gruppe und 1,76 pro 1.000 in der Standardgruppe auf.

19. A megfigyelt alacsonyabb arány az új eljárás mellett szólt, de a különbséget övező bizonytalanság miatt – a számok kedvező irányultsága ellenére – nem állapítható meg, hogy ez a mutató tekintetében az új eljárás felsőbbrendű lenne. – Die niedrigere beobachtete Rate sprach für das neue Verfahren, doch die Unsicherheit hinsichtlich dieses Unterschieds ließ trotz der vielversprechenden Tendenz der Zahlen keinen Schluss zu, dass es in dieser Hinsicht überlegen war.

20. A vizsgálat teljesítette az előre meghatározott nem-alacsonyabb hatékonysági tesztet: a konfidencia-intervallum felső határa legfeljebb 18 százalékos relatív növekedést engedélyezett, ami a korábban meghatározott 20 százalékos határ alatt maradt. – Die Studie erfüllte ihren vorab festgelegten Nichtunterlegenheitstest: Die Obergrenze ihres Konfidenzintervalls ließ einen relativen Anstieg von bis zu 18 Prozent zu, was unter der im Voraus festgelegten Marge von 20 Prozent lag.

21. Ez egy korlátozott állításra utal, nem pedig garanciát jelent a kimaradt rákos megbetegedések ellen. – Dies ist ein Beleg für eine begrenzte Aussage, keine Garantie gegen übersehene Krebserkrankungen.

22. Az érzékenység – azaz a később felfedezett rákok helyett a szűréssel azonosított rákok aránya – 80,5 százalék volt a mesterséges intelligencia támogatásával, és 73,8 százalék a hagyományos kettős értékelés esetén; ezt a különbséget a tanulmány statisztikailag is igazolta. – Die Sensitivität, also der Anteil der Krebserkrankungen, die durch das Screening erkannt und nicht erst später entdeckt wurden, betrug 80,5 Prozent bei KI-Unterstützung und 73,8 Prozent bei der herkömmlichen doppelten Befundung – ein Unterschied, den die Studie statistisch nachweisen konnte.

23. A specifitás – azaz a rákmentes vizsgálatok aránya, amelyeket helyesen negatívnak minősítettek – mindkét csoportban 98,5 százalék volt. – Die Spezifität, also der Anteil der krebsfreien Untersuchungen, die korrekt als negativ eingestuft wurden, lag in beiden Gruppen bei 98,5 Prozent.

24. Ezek az adatok egy hasznos kombinációt mutatnak: a vizsgálatban számba vett rákos megbetegedések közül többet szűrés során fedeztek fel anélkül, hogy a specifitás mérhető csökkenése történt volna, ami azt jelentette volna, hogy több rákmentes nőt kezeltek volna gyanús esetként . – Diese Zahlen beschreiben eine nützliche Kombination: Ein größerer Anteil der in der Studie erfassten Krebserkrankungen wurde im Rahmen der Vorsorgeuntersuchung entdeckt, ohne dass dabei ein messbarer Verlust an Spezifität auftrat, was bedeutet hätte, dass mehr krebsfreie Frauen als verdächtig eingestuft worden wären.

25. Ezek az adatok nem bizonyítják, hogy a rendszer csökkentette volna a halálozást, kiküszöbölte volna a túldiagnosztizálást, vagy biztonságosabbá tette volna minden egyes döntést . – Sie zeigen jedoch nicht, dass das System die Zahl der Todesfälle verringert, Überdiagnosen beseitigt oder jede einzelne Beurteilung sicherer gemacht hat.

26. A vizsgálat nem tudja elkülöníteni a detektálási küszöb hatását attól a hatástól, hogy egyes képeket egy, másokat pedig két értékelőnek továbbítottak, mivel mindkét változás együttesen működött a tesztelt eljárásban . – Ebenso wenig kann die Studie die Wirkung einer Erkennungsmarkierung von der Wirkung der Weiterleitung einiger Bilder an einen Befunder und anderer an zwei Befunder trennen, da beide Änderungen im getesteten Verfahren zusammenwirkten.

27. A bizonyíték egysége az az eljárás, amellyel a betegek ténylegesen találkoztak . – Ihre Evidenzgrundlage ist das Verfahren, dem die Patientinnen tatsächlich ausgesetzt waren.

28. Pontosan ezért értékes a tanulmány a bizalomról való gondolkodás szempontjából: egy szűrőprogram nem izoláltan alkalmaz egy algoritmust, hanem beépíti azt az emberi cselekvések sorozatába. – Genau deshalb ist die Studie für Überlegungen zum Thema Vertrauen wertvoll: Ein Vorsorgeprogramm wendet einen Algorithmus nicht isoliert an, sondern bettet ihn in eine Abfolge menschlicher Handlungen ein.

29. A megfelelő mértékű bizalom attól függ, hogy az adott sorozat bizonyíthatóan mit ér el . – Das richtige Maß an Vertrauen hängt davon ab, was diese Abfolge nachweislich bewirkt .

30. Attól is függ, hogy a megnyugtató eredmény után észlelhetők-e a hibák . – Es hängt auch davon ab, ob Fehler nach einem beruhigenden Ergebnis bemerkt werden können .

31. A szűrés során egy hamis negatív eredmény csak akkor válhat láthatóvá, ha később rákot diagnosztizálnak, míg egy ártalmatlan kép kivizsgálására irányuló felszólítás azonnali további vizsgálatokhoz vezethet . – Bei der Vorsorgeuntersuchung wird ein falsch-negatives Ergebnis möglicherweise erst sichtbar, wenn später eine Krebserkrankung diagnostiziert wird, während eine Aufforderung zur Untersuchung eines harmlosen Befunds zu sofortigen zusätzlichen Untersuchungen führen kann .

32. Ezeknek a hibáknak eltérő időbeli lefolyása van, és eltérő költségekkel járnak az érintett nők számára. – Diese Fehler verlaufen zeitlich unterschiedlich und verursachen unterschiedliche Kosten für die betroffenen Frauen.

33. Egyetlen pontossági érték nem árulja el az értelmezőnek, hogy melyik kockázatot fogadták el. – Ein einzelner Genauigkeitswert kann einem Befunder nicht sagen, welches Risiko akzeptiert wurde .

34. A „kalibrált bizalom” kifejezés azt jelenti, hogy a bizalom ott növekszik, ahol a rendszer kiérdemelte, és ott csökken, ahol a rendszer teljesítménye, a rendelkezésre álló bizonyítékok vagy a tét nem támasztja alá. – Der Begriff „kalibriertes Vertrauen“ bedeutet, dass das Vertrauen dort steigt, wo ein System es sich verdient hat, und dort sinkt, wo seine Leistung, die verfügbaren Erkenntnisse oder die Tragweite dies nicht rechtfertigen.

35. A kalibrálás nem a radiológus személyiségjegye. – Kalibrierung ist kein Persönlichkeitsmerkmal eines Radiologen .

36. Ez egy feladat, egy eszköz, egy kijelző, egy emberi munkafolyamat és a visszajelzés közötti kapcsolat, amely feltárja, hogy együttes ítéletük helyes volt-e, különösen akkor, ha a hibák csak az azonnali döntés meghozatala után derülnek ki . – Es handelt sich um eine Beziehung zwischen einer Aufgabe, einem Gerät, einer Anzeige, einem menschlichen Arbeitsablauf und dem Feedback, das aufzeigt, ob ihre kombinierten Beurteilungen richtig waren – insbesondere dort, wo Fehler erst nach der unmittelbaren Entscheidung zutage treten .

37. Még egy rendkívül pontos rendszer is téves bizalomra adhat okot, ha hallgatását annak bizonyítékaként értelmezik, hogy nincs semmi baj. – Selbst ein hochpräzises System kann zu unangebrachtem Vertrauen verleiten, wenn sein Schweigen als Beweis dafür gewertet wird, dass alles in Ordnung ist.

38. A képen lévő jelölés éppen ellenkező problémát okozhat: olyan erősen vonzza a figyelmet, hogy más bizonyítékok túl kevés súlyt kapnak . – Eine Markierung auf einem Bild kann das gegenteilige Problem mit sich bringen, indem sie die Aufmerksamkeit so stark auf sich zieht, dass anderen Hinweisen zu wenig Gewicht beigemessen wird.

39. A svéd kísérlet az adott elrendezés következményeit mérte fel; nem tette semmilyen veszélyt eltűnővé minden jövőbeli klinikán . – Die schwedische Studie untersuchte die Folgen dieser speziellen Anordnung; sie hat keine der beiden Gefahren in jeder zukünftigen Klinik beseitigt .

40. Laboratóriumi kutatások azt mutatják, hogy ugyanaz a logika hogyan bukhat meg egy teljesen más környezetben. – Laboruntersuchungen zeigen, wie dieselbe Logik in einem ganz anderen Umfeld versagen kann.

41. Linda Skitka, Kathleen Mosier és Mark Burdick olyan embereket vizsgáltak, akik számítógépes figyelemmel kísérés és ajánlások mellett szimulált repülési feladatot hajtottak végre. – Linda Skitka, Kathleen Mosier und Mark Burdick untersuchten Personen, die eine simulierte Flugaufgabe unter computergestützter Überwachung und mit Empfehlungen durchführten.

42. Amikor az automatizált segédrendszer nem jelezte a problémát, egyes résztvevők elmulasztottak olyan eseményeket, amelyek egyébként észlelhetők lettek volna; a hiányzó figyelmeztetés okot adott arra, hogy ne vizsgálódjanak tovább. – Wenn die automatisierte Hilfe ein Problem nicht meldete, übersahen einige Teilnehmer Ereignisse, die ansonsten erkennbar gewesen wären; die fehlende Warnung war zu einem Grund geworden, nicht weiter nachzuschauen.

43. Ezek mulasztási hibák voltak . – Dies waren Unterlassungsfehler.

44. Máskor a résztvevők hibás tanácsokat követtek, annak ellenére, hogy érvényes, ellentmondó jelzések voltak láthatók a kijelzőn, ami azt mutatja, hogy a helyes információ jelenléte nem garantálja annak felhasználását. – In anderen Fällen folgten die Teilnehmer fehlerhaften Ratschlägen, obwohl auf dem Display gültige, widersprüchliche Hinweise verfügbar waren, was zeigt, dass das Vorhandensein korrekter Informationen deren Nutzung nicht gewährleistet.

45. Ezek cselekvési hibák voltak: a segédeszköz nem csupán nem nyújtott segítséget, hanem elterelte a figyelmet a jobb információkról . – Das waren Aktionsfehler: Die Hilfe versagte nicht nur, sondern lenkte das Handeln von besseren Informationen ab.

46. Az egyik esetben az üres riasztási csatorna kevésbé láthatóvá teszi a valódi zavarokat . – In einem Muster macht ein leerer Warnkanal eine tatsächliche Störung weniger sichtbar.

47. A másikban a kifejezett utasítás túl nagy tekintélyt nyer. – Im anderen gewinnt eine explizite Anweisung zu viel Autorität.

48. Ezek olyan mechanizmusok, amelyeket ellenőrzött szimulációban figyeltek meg, nem pedig valós balesetek összesítéséből vagy a mellszűrés kockázatának méréséből. – Dies sind Mechanismen, die in einer kontrollierten Simulation beobachtet wurden, keine Aufstellung realer Abstürze oder ein gemessenes Risiko für die Brustkrebsvorsorge.

49. Az összehasonlítás azért hasznos, mert rámutat arra, hol csúszhat át a bizalom egy tesztelt funkcióból egy teszteletlen feltételezésbe a hallgatásról vagy a tanácsadásról . – Der Vergleich ist nützlich, weil er aufzeigt, wo Vertrauen von einer getesteten Funktion auf eine ungeprüfte Annahme über Schweigen oder Ratschläge übergehen kann .

50. A számítógép üzenete megváltoztatja, amit a kezelő ellenőriz, néha jobban, mint amennyire a mögöttes bizonyítékot megváltoztatja . – Die Meldung des Computers verändert, was der Bediener überprüft – manchmal stärker, als sie die zugrunde liegenden Beweise verändert .

51. Ha mindkét reakciót lustaságnak neveznénk, az elrejtené a tervezési problémát. – Beide Reaktionen als „Faulheit“ zu bezeichnen, würde das Designproblem verschleiern.

52. Több folyamat figyelemmel kísérése időnyomás alatt felemészti a figyelmet, és egy általában helyes segédeszköz pontosan abban a pillanatban teheti feleslegessé a független ellenőrzést, amikor egy kivétel számít. – Die Überwachung mehrerer Datenströme unter Zeitdruck beansprucht die Aufmerksamkeit, und eine Hilfe, die normalerweise richtig liegt, kann eine unabhängige Überprüfung genau in dem Moment überflüssig erscheinen lassen, in dem eine Ausnahme von Bedeutung ist.

53. Az ellentmondás jelen lehet a képernyőn, mégis nehezen használható . – Der Widerspruch mag zwar auf dem Bildschirm vorhanden sein, aber dennoch schwer zu nutzen sein .

54. Elhelyezkedése, egyértelműsége és időzítése befolyásolja, hogy versenyképes-e egy kiemelt automatizált ajánlással . – Seine Position, Klarheit und der Zeitpunkt beeinflussen, ob er mit einer auffälligen automatisierten Empfehlung konkurrieren kann.

55. Kapcsolódó repülési feladatokkal kapcsolatos kísérletekben egy második személy bevonása vagy pusztán az, hogy a résztvevőket arra kérték, ellenőrizzék a segédeszközt, nem szüntette meg megbízhatóan ezeket a hibákat, amelyek ezeknek a látszólag egyszerű biztonsági intézkedéseknek ellenére is fennmaradtak . – In verwandten Experimenten zu Flugaufgaben konnten diese Fehler nicht zuverlässig beseitigt werden, indem eine zweite Person hinzugezogen oder die Teilnehmer lediglich angewiesen wurden, die Hilfe zu überprüfen; die Fehler blieben trotz dieser scheinbar einfachen Sicherheitsvorkehrungen bestehen.

56. Ez a megállapítás nem teszi feleslegessé a képzést; csupán azt jelenti, hogy a homályos utasítások nem elegendő ellenőrzési eszközök . – Diese Erkenntnis macht das Training nicht nutzlos; sie macht vage Anweisungen zu einer unzureichenden Kontrollmaßnahme .

57. Az operátoroknak meg kell tanulniuk, milyen hibákat követhet el a segédeszköz, hol jelennek meg független bizonyítékok, és milyen megfigyelhető körülmények indokolják a második ellenőrzést, amíg még van idő a szükséges intézkedésre . – Die Bediener müssen lernen, welche Fehler die Hilfsfunktion machen kann, wo unabhängige Hinweise erscheinen und welcher beobachtbare Zustand eine zweite Überprüfung erfordert, solange noch Zeit bleibt, darauf zu reagieren .

58. A képzésnek meg kell felelnie annak a feladatnak, amelyet a résztvevők ténylegesen végrehajtanak . – Das Training muss auf die Aufgabe abgestimmt sein, die sie tatsächlich ausführen werden.

59. Ellenkező esetben a „legyen éber” felszólítás olyan kötelezettséget ró a felhasználóra, anélkül, hogy működőképes módszert biztosítana a gép által kihagyott elemek észlelésére. – Andernfalls fügt die Aufforderung, „wachsam zu bleiben“, eine zusätzliche Pflicht hinzu, ohne eine praktikable Möglichkeit zu bieten, zu erkennen, was die Maschine übersehen hat .

60. A szűrőteremben tehát a kiemelt terület csupán egy bizonyíték a sok közül . – Zurück im Befundungsraum ist ein hervorgehobener Bereich daher nur ein Anhaltspunkt .

61. A kép továbbra is a radiológus rendelkezésére áll, akinek feladata eldönteni, hogy egy látható jellemző figyelmet érdemel-e akkor is, ha mellette nem jelenik meg gépi jelölés, és hogy egy jelölés valódi aggodalomra ad-e okot. – Das Bild steht dem Radiologen weiterhin zur Verfügung, zu dessen Aufgabe es gehört, zu entscheiden, ob ein sichtbares Merkmal Beachtung verdient, auch wenn keine maschinengenerierte Markierung daneben erscheint, und ob eine Markierung auf ein echtes Problem hinweist.

62. Ez a megkülönböztetés egy hosszú vizsgálatsorozat során egyre nehezebbé válik. – Diese Unterscheidung wird bei einer langen Reihe von Untersuchungen immer schwieriger.

63. A csend megnyugtató jelzésként kezdhet működni, ha a rendszer már a legtöbb képet átnézte, és korábbi riasztásai gyakran hasznosnak bizonyultak . – Schweigen kann als Beruhigung wirken, wenn das System bereits die meisten Bilder sortiert hat und sich seine früheren Warnmeldungen oft als nützlich erwiesen haben.

64. Egy független jel pontosan akkor értékes, ha eltérő véleményt fogalmazhat meg. – Ein unabhängiges Signal hat gerade dann Wert, wenn es abweichen kann.

65. Ha egy második olvasó csupán azt a területet keresi, amelyet a modell bekeretezett, akkor a két névleges olvasat egy közös figyelmi vonalat jelenthet, így a kép jelöletlen részei nem kerülnek alaposabb vizsgálat alá. – Wenn ein zweiter Befunder lediglich nach dem Bereich sucht, den das Modell eingekreist hat, können zwei nominelle Befunde auf eine gemeinsame Aufmerksamkeitsebene hinauslaufen, wodurch unmarkierte Teile des Bildes nicht besser untersucht werden.

66. A kettős olvasás értéke attól függ, hogy mit vesz észre az egyes olvasók anélkül, hogy a másik vakfoltjait is figyelembe vennék, ezért a megállapítások feltárásának sorrendje ugyanolyan fontos lehet, mint a résztvevők száma. – Der Wert der doppelten Begutachtung hängt davon ab, was jeder Begutachter erkennen kann, ohne auf die blinden Flecken des anderen zurückzugreifen; deshalb kann die Reihenfolge, in der Befunde offengelegt werden, ebenso wichtig sein wie die Anzahl der Begutachter.

67. Egy jelölés segíthet anélkül, hogy minden megjelölés nélküli területet rangsorolna . – Eine Markierung kann hilfreich sein, ohne jeden nicht markierten Bereich zu bewerten .

68. A jó tervezésnek lehetővé kell tennie ezeket a megkülönböztetéseket a mindennapi munka során, amikor sok kép vár felülvizsgálatra, és az olvasónak gyorsan el kell döntenie, hogy egy automatizált jelzés mikor érdemel figyelmet, és mikor nem. – Ein gutes Design muss diese Unterscheidungen im Arbeitsalltag ermöglichen, wenn viele Bilder auf die Begutachtung warten und der Begutachter schnell entscheiden muss, wo ein automatisierter Hinweis Beachtung verdient und wo nicht.

69. A kísérlet során elért 44 százalékos munkaterhelés-csökkenés operatívvá teszi ezt a kérdést. – Die im Rahmen der Studie erzielte Arbeitsentlastung von 44 Prozent macht diese Frage praxisrelevant.

70. Amikor olvasási kapacitást takarítanak meg, egyes vizsgálatok már nem részesülnek ugyanannyi független emberi ellenőrzésben, mint korábban, annak ellenére, hogy minden nő továbbra is megkapja a szűrővizsgálati eredményt, és a megnyugtató eredmény alapján cselekedhet . – Wenn Auswertungskapazitäten eingespart werden, erhalten manche Untersuchungen nicht mehr die gleiche Anzahl unabhängiger menschlicher Begutachtungen wie zuvor, auch wenn jede Frau weiterhin ein Screening-Ergebnis erhält und sich auf dessen beruhigende Wirkung verlassen kann .

71. Ez indokolt kompromisszum lehet, ha a kombinált folyamat elég jól teljesít, különösen ott, ahol a szűkös olvasási időt másra lehetne fordítani. – Das kann ein gerechtfertigter Kompromiss sein, wenn der kombinierte Prozess gut genug funktioniert, insbesondere wenn die knappe Auswertungszeit anderweitig genutzt werden könnte.

72. Ez továbbra is olyan csere, amelynek költségeit nem lehet kizárólag a munkaerő-megtakarításból levezetni . – Es handelt sich nach wie vor um einen Austausch, dessen Kosten sich nicht allein aus den Einsparungen bei den Personalkosten ableiten lassen.

73. Azok a nők, akiknél a rák a negatív szűrővizsgálat után jelentkezik, különösen fontosak az értékelés szempontjából, mivel eseteik olyan hibákat tárnak fel, amelyeket az első értékelés nem tudott magáról jelenteni . – Die Frauen, bei denen nach einem negativen Screening eine Krebserkrankung auftritt, sind für die Bewertung besonders wichtig, da ihre Fälle Mängel aufdecken, die bei der ersten Befundung nicht erkannt werden konnten.

74. Ezen esetek áttekintése rávilágíthat arra, hogy egy gyanús jel hiányzott-e, jelen volt-e, de nehezen észrevehető, megjelölve volt-e, de figyelmen kívül hagyták, vagy egyáltalán nem jelölték meg, így a későbbi diagnózis információt nyújt egy korábbi döntésről . – Die Überprüfung dieser Fälle kann zeigen, ob ein verdächtiges Merkmal fehlte, zwar vorhanden, aber schwer zu erkennen war, markiert und außer Acht gelassen wurde oder gar nicht erst markiert wurde, sodass eine spätere Diagnose Aufschluss über eine frühere Entscheidung gibt .

75. Minden egyes mintázat más-más korrekciót igényel. – Jedes Muster erfordert eine andere Korrektur.

76. Egy továbbfejlesztett detektor az egyik esetben segíthet, míg egy megváltozott kijelzés vagy egy másik útválasztási szabály egy másik esetben jelentősebb lehet. – Ein verbesserter Detektor könnte bei dem einen helfen, während bei einem anderen eine geänderte Anzeige oder eine andere Weiterleitungsregel entscheidender sein könnte.

77. Ha minden elmulasztást úgy kezelünk, mintha az ember nem bízott volna a modellben, akkor a munkafolyamat diagnózisát összetévesztenénk a személyiségre vonatkozó ítélettel. – Jeden Fehlbefund als Beweis dafür zu betrachten, dass der Mensch dem Modell nicht vertraut hat, würde eine Diagnose des Arbeitsablaufs mit einer Beurteilung des Temperaments verwechseln.

78. Az automatizálás iránti túlzott óvatosság saját veszteségeket okoz. – Übermäßige Vorsicht gegenüber der Automatisierung verursacht ihre eigenen Verluste.

79. Berkeley Dietvorst, Joseph Simmons és Cade Massey olyan embereket vizsgáltak, akik a saját előrejelzéseik és egy algoritmus előrejelzései között kellett választaniuk. – Berkeley Dietvorst, Joseph Simmons und Cade Massey untersuchten Menschen, die zwischen ihren eigenen Prognosen und denen eines Algorithmus wählen mussten.

80. Miután látták, hogy az algoritmus hibázik, a résztvevők kevésbé voltak hajlandók használni azt, még akkor is, ha a megfigyelt algoritmus jobban teljesített, mint az emberi alternatíva – ez az összehasonlítás a kísérlet során a rendelkezésükre állt. – Nachdem die Teilnehmer gesehen hatten, dass der Algorithmus Fehler machte, waren sie weniger bereit, ihn zu nutzen – selbst wenn der beobachtete Algorithmus besser abgeschnitten hatte als die menschliche Alternative, ein Vergleich, der ihnen im Experiment zur Verfügung stand.

81. A látható hiba nagyobb súllyal esett latba, mint a teljes teljesítmény összehasonlítása . – Der sichtbare Fehler hatte mehr Gewicht als der Vergleich der Gesamtleistung.

82. Ez az alulbizalom, amikor a bizonyítékok a modell mellett szólnak. – Das ist „Undertrust“, wenn die Beweislage für das Modell spricht.

83. Ez nem általános irányelv arra, hogy mindig azt a modellt részesítsük előnyben, amely átlagosan felülmúlja az embert . – Es handelt sich nicht um eine allgemeine Anweisung, ein Modell immer dann zu bevorzugen, wenn es im Durchschnitt besser abschneidet als ein Mensch.

84. A kísérlet résztvevői egy meghatározott előrejelzési feladattal szembesültek, olyan kimenetelekkel és ösztönzőkkel, amelyek nem vihetők át teljes egészükben egy klinikára vagy pilótafülkébe, ahol a hibákat nehezebb lehet számba venni, és következményeik is sokkal kevésbé hasonlóak . – Die Versuchsteilnehmer standen vor einer definierten Prognoseaufgabe mit Ergebnissen und Anreizen, die sich nicht eins zu eins auf eine Klinik oder ein Cockpit übertragen lassen, wo Fehler möglicherweise schwerer zu erfassen sind und weitaus unterschiedliche Folgen haben .

85. Ott egy ritka hiba olyan következménnyel járhat, amelyet az átlagos pontszám elrejt. – Dort kann ein seltener Fehler eine Konsequenz nach sich ziehen, die ein Durchschnittswert verschleiert.

86. A kísérlet inkább egy olyan kérdést vet fel, amelyet bármely döntéshozó feltehet: mi számítana elfogadható hibaaránynak ebben a konkrét alkalmazásban, és hogyan teljesít a rendelkezésre álló alternatíva? – Das Experiment wirft stattdessen eine Frage auf, die sich jeder Entscheidungsträger stellen kann: Was würde für diesen speziellen Anwendungsfall als akzeptable Fehlerquote gelten, und wie schneidet die verfügbare Alternative ab?

87. Az emberi előrejelzések is tévedhetnek, de hibáik kevésbé tűnnek a módszer ellen szóló bizonyítéknak. – Auch menschliche Prognosen liegen daneben, doch ihre Fehler wirken möglicherweise weniger wie ein Beweis gegen die Methode selbst .

88. Ezzel szemben egy algoritmus hibája úgy tűnhet, mintha megszegné a mechanikus következetesség ígéretét, amit egyetlen ésszerű értékelés sem tett soha. – Der Fehler eines Algorithmus hingegen kann den Anschein erwecken, ein Versprechen mechanischer Konsistenz zu brechen, das keine fundierte Bewertung jemals abgegeben hat.

89. Ez az aszimmetria oda vezethet, hogy az emberek egy szembetűnő kudarc után elfordulnak egy hasznos segédeszköztől, miközben továbbra is elnézik a kevésbé látható emberi hibákat, még akkor is, ha a két módszer tisztességes összehasonlítása a segédeszköz mellett szól . – Diese Asymmetrie kann dazu führen, dass Menschen eine nützliche Hilfe nach einem auffälligen Fehlschlag aufgeben, während sie weniger sichtbare menschliche Fehler weiterhin verzeihen – selbst wenn ein fairer Vergleich der beiden Methoden für die Hilfe spricht .

90. A kutatók később azt találták, hogy a résztvevők gyakrabban használták a nem tökéletes előrejelző algoritmust, ha akár csak kis mértékben is módosíthatták annak előrejelzéseit . – Die Forscher stellten später fest, dass die Teilnehmer einen unvollkommenen Prognosealgorithmus häufiger nutzten, wenn sie selbst kleine Anpassungen an dessen Vorhersagen vornehmen konnten .

91. Ez az eredmény nem igazolja minden esetben a saját belátás szerinti szerkesztést. – Dieses Ergebnis rechtfertigt jedoch nicht in jedem Fall eine eigenmächtige Bearbeitung.

92. Egy módosítás növelheti a modellhez fordulás hajlandóságát, ugyanakkor új hibaforrást is bevezethet. – Eine Anpassung kann die Bereitschaft erhöhen, ein Modell zu konsultieren, führt aber gleichzeitig eine neue Fehlerquelle ein.

93. Hasznosságát a ténylegesen meghozott döntések alapján kell tesztelni, beleértve azokat is, amelyeket a felhasználó szerkesztései módosítottak, nem pedig abból kiindulva, hogy a kezelő mennyire elégedett a szerkesztések végzése közben . – Seine Nützlichkeit muss anhand der tatsächlich getroffenen Entscheidungen geprüft werden, einschließlich derer, die durch die Bearbeitungen des Nutzers verändert wurden, und nicht anhand der Zufriedenheit, die der Anwender bei diesen Bearbeitungen empfindet .

94. A túlzott bizalom és az alulbecsült bizalom akár egyazon munkahelyen is egymás mellett létezhet. – Übermäßiges Vertrauen und mangelndes Vertrauen können sogar am selben Arbeitsplatz nebeneinander bestehen .

95. Előfordulhat, hogy valaki figyelmen kívül hagyja az algoritmus általános ajánlását, ugyanakkor egy adott numerikus pontszámot pontosabbnak tekint, mint amit a bizonyítékok indokolnának . – Eine Person kann die allgemeine Empfehlung eines Algorithmus ignorieren, aber dennoch eine bestimmte numerische Bewertung als präziser betrachten, als es die Beweislage rechtfertigt.

96. Másvalaki viszont követheti a feltűnő riasztást, miközben figyelmen kívül hagyja annak a lehetőségét, hogy a meg nem jelölt esetekben is előfordulhat a betegség. – Eine andere Person folgt vielleicht einer auffälligen Warnmeldung, ignoriert dabei jedoch die Möglichkeit, dass auch nicht markierte Fälle noch eine Erkrankung enthalten .

97. A hiba iránya attól függ, hogyan jelenik meg az információ, mit gondol a felhasználó, hogy az mit jelent, és hogy a környező munkakörnyezetben elég könnyű-e időben megtalálni az ellentmondó bizonyítékokat. – Die Richtung des Fehlers hängt davon ab, wie die Informationen dargestellt werden, was der Nutzer glaubt, was sie darstellen, und ob die umgebenden Arbeitsabläufe es leicht genug machen, widersprüchliche Beweise rechtzeitig zu finden.

98. A munkaterhelés is számít: ha kevés az idő, egy megbízható segédeszköz tehermentesítheti a figyelmet, míg a megbízhatatlan riasztások áradata éppen azt a figyelmet emésztheti fel, amelyre a független ellenőrzésekhez szükség van . – Auch die Arbeitsbelastung spielt eine Rolle: Wenn die Zeit knapp ist, kann eine zuverlässige Hilfe Aufmerksamkeit freisetzen, während ein unzuverlässiger Strom von Warnmeldungen genau die Aufmerksamkeit beanspruchen kann, die für unabhängige Überprüfungen benötigt wird.

99. A gyakoriság azért fontos, mert egy ritka hiba esetében nehéz lehet első kézből tanulni a tapasztalatból . – Die Häufigkeit ist von Bedeutung, da es schwierig sein kann, aus eigener Erfahrung aus einem seltenen Fehler zu lernen.

100. A következmények azért fontosak, mert az elmulasztott esetek és a felesleges utánkövetés közötti elfogadható egyensúly klinikai és emberi megítélés kérdése, nem pedig kizárólag a modell pontosságából adódó tulajdonság . – Die Konsequenzen sind von Bedeutung, da das akzeptable Gleichgewicht zwischen übersehenen Fällen und unnötigen Nachuntersuchungen eine klinische und menschliche Beurteilung ist und nicht allein durch die Genauigkeit eines Modells bestimmt wird .

101. A lényeg nem az, hogy a felhasználók minden kimenetet egyformán gyanúsnak tekintsék . – Es geht nicht darum, die Nutzer gegenüber jeder Ausgabe gleichermaßen misstrauisch zu machen.

102. Hanem az, hogy minden bizalmi cselekményt összekapcsoljunk az adott kimenet szerepére vonatkozó bizonyítékokkal, valamint egy megvalósítható módszerrel, amellyel felfedezhető, ha az meghibásodik . – Es geht darum, jeden Akt des Vertrauens mit Belegen über die Rolle dieser Ausgabe und mit einer praktikablen Möglichkeit zu verknüpfen, festzustellen, wann sie versagt .

103. Egy hasznos hibaüzenet azonosítja, mit hagyott ki a rendszer vagy mit jelölt meg tévesen, a hiba körülményeit, valamint azt, hogy volt-e az embernek használható lehetősége észrevenni azt. – Ein nützlicher Fehlerbericht identifiziert, was das System übersehen oder fälschlicherweise markiert hat, die Umstände des Fehlers und ob ein Mensch eine verwertbare Gelegenheit hatte, ihn zu bemerken.

104. Ha csak a végső diagnózist vennénk figyelembe, elszalasztanánk a lehetőséget, hogy megkülönböztessük az észlelési hibát az irányítás vagy a válaszadás hibájától – ezek a megkülönböztetések pedig meghatározzák, hogy az eljárás mely részét kell megváltoztatni. – Würde man nur die endgültige Diagnose zählen, würde man die Chance verpassen, einen Erkennungsfehler von einem Fehler bei der Weiterleitung oder Reaktion zu unterscheiden – Unterscheidungen, die darüber entscheiden, welcher Teil des Verfahrens geändert werden muss.

105. Egy független ellenőrző jelnek elég jól láthatónak kell maradnia ahhoz, hogy megkérdőjelezze a segédeszközt. – Ein unabhängiges Kontrollsignal muss sichtbar genug bleiben, um die Hilfsfunktion zu hinterfragen.

106. Egy repülési kijelzőn ez azt jelentheti, hogy a jelzés nem ugyanabból a hibás ajánlásból származik; szűrés során pedig azt jelentheti, hogy egy emberi értékelés vagy későbbi klinikai információ, amelyet a modell pontszáma nem szűr ki. – In einer Fluganzeige kann das eine Anzeige bedeuten, die nicht aus derselben fehlerhaften Empfehlung abgeleitet wurde; bei der Vorsorgeuntersuchung kann es eine menschliche Beurteilung oder spätere klinische Informationen bedeuten, die nicht durch die Bewertung des Modells herausgefiltert werden.

107. A kétszer értelmezett esetekből álló minták – beleértve azokat is, amelyeket a modell alacsony kockázatúnak tekint – alkalmasak annak vizsgálatára, hogy a második értelmezések számának csökkentése elrejti-e azokat a téves észlelési mintákat, amelyek soha nem jelennek meg a már különös figyelmet kapó, magas kockázatú képek között. – Stichproben von doppelt ausgewerteten Fällen, einschließlich solcher, die das Modell als risikoarm einstuft, können prüfen, ob die Reduzierung von Zweitauswertungen ein Muster von Übersehen verbirgt, das bei den bereits besonders genau untersuchten Hochrisikobildern niemals auftreten würde.

108. A mintának elég nagynak és célzottnak kell lennie a vizsgált hibák szempontjából, mivel néhány egyszerű eset alig nyújtana megnyugvást a ritka, súlyos következményekkel járó hibák tekintetében . – Die Stichprobe muss groß und für die betreffenden Fehler zielgerichtet genug sein, da eine Handvoll einfacher Fälle wenig Sicherheit hinsichtlich seltener, folgenschwerer Fehler bieten würde.

109. A szűrővizsgálati körök közötti időközök további ellenőrzést nyújtanak, bár eredményeik lassan érkeznek, és nem orvosolhatják a már érintett nő esetében elmulasztott diagnózist. – Die Intervalle zwischen den Screening-Runden bieten eine weitere Kontrollmöglichkeit, auch wenn ihre Ergebnisse nur langsam vorliegen und eine übersehene Diagnose bei der bereits betroffenen Frau nicht mehr korrigieren können.

110. A visszacsatolás ezért szükséges, de nem helyettesíti az első értékelés során tanúsított gondosságot. – Feedback ist daher notwendig, ersetzt jedoch nicht die Sorgfalt bei der Erstauswertung.

111. A képzésnek fel kell tárnia a segédeszköz ismert hibamódjait, és lehetővé kell tennie az értékelők számára, hogy gyakorolják a gép jelzése és egy független jelzés közötti eltérés feloldását. – Die Schulung sollte die bekannten Fehlermodi des Hilfsmittels aufzeigen und es den Auswertern ermöglichen, die Auflösung von Unstimmigkeiten zwischen einem maschinellen Hinweis und einer unabhängigen Indikation zu üben.

112. Emellett meg kell magyaráznia a teljesítményre vonatkozó állítások mögött álló alapszázalékokat és nevezőket is, hogy egy feltűnő hiba ne törölje ki a több ezer helyes döntést, vagy egy kedvező átlag ne rejtsen el a legfontosabb hibákat. – Sie sollte zudem die Basisraten und Nenner hinter Leistungsangaben erläutern, damit ein auffälliger Fehler nicht Tausende korrekter Entscheidungen zunichte macht oder ein schmeichelhafter Durchschnitt die Fehler verdeckt, auf die es am meisten ankommt.

113. Ezek a biztonsági intézkedések a megtakarított munkaerő egy részét felemésztik. – Diese Sicherheitsvorkehrungen verbrauchen einen Teil der eingesparten Arbeitskraft.

114. Ezt a költséget figyelembe kell venni az összehasonlításban, mert a rendszer biztonságához hozzátartozik az a munka is, amely a rendszer határainak ellenőrzéséhez szükséges. – Diese Kosten müssen in den Vergleich einbezogen werden, da die Sicherheit eines Systems auch den Aufwand umfasst, der erforderlich ist, um seine Grenzen zu überprüfen.

115. A svéd vizsgálat meggyőzőbb bizonyítékot szolgáltat, mint a lenyűgöző képek bemutatása: teljes szűrővizsgálati eljárásokat hasonlított össze, és elég hosszú ideig követte a nőket ahhoz, hogy az intervallumrákokat is számba vehesse. – Die schwedische Studie liefert stichhaltigere Belege als die Präsentation eindrucksvoller Bilder: Sie verglich vollständige Vorsorgeverfahren und begleitete die Frauen lange genug, um Intervallkarzinome zu erfassen.

116. Ugyanakkor a kedvező átlagértékek a vizsgált rendszerhez, populációhoz, értékelőkhöz és megfigyelési időszakhoz tartoznak, nem pedig automatikusan minden olyan helyszínhez, amely hasonló szoftvert telepít eltérő körülmények között, vagy megváltoztatja az emberi értékelések arányát . – Doch seine günstigen Durchschnittswerte beziehen sich auf die getestete Konfiguration, Population, die Befunder sowie den Beobachtungszeitraum und gelten nicht automatisch für jede Einrichtung, die ähnliche Software unter anderen Bedingungen einsetzt oder das Verhältnis der manuellen Befundungen verändert .

117. A használat elterjedésével az a lényeges kérdés, hogy a berendezések, a betegek, a személyzet vagy a gyakorlat változásai megváltoztatják-e azt a hibamintát, amelyet az eredeti vizsgálat mért. – Mit zunehmender Verbreitung stellt sich die entscheidende Frage, ob Veränderungen bei der Ausrüstung, den Patientinnen, der Personalausstattung oder der Praxis das Fehlermuster verändern, das in der ursprünglichen Studie gemessen wurde.

118. Egy eljárás bizonyos esetekben megbízhatónak bizonyulhat, míg más esetekben továbbra is két értékelőre van szükség. – Ein Verfahren kann in einigen Fällen Vertrauen gewinnen, während es in anderen Fällen weiterhin zwei Auswerter erfordert.

119. A bizalom döntő próbája nem az, hogy a modell képes-e rákot felismerni, hanem az, hogy a szűrővizsgálati szolgálat képes-e felismerni azokat a rákos elváltozásokat, amelyeket saját figyelmének elosztása miatt figyelmen kívül hagy . – Der entscheidende Test für das Vertrauen ist nicht, ob das Modell einen Krebs erkennen kann, sondern ob der Screening-Dienst erkennen kann, welche Krebserkrankungen durch seine eigene Aufmerksamkeitsverteilung übersehen werden .

120. A megjelölés nélküli kép és a későbbi diagnózis továbbra is a bizonyíték részét képezik. – Das nicht markierte Bild und die spätere Diagnose bleiben Teil der Beweislage.

(aufklappen)magyar

1. A svéd MASAI-vizsgálatban a mammográfiás felvételek nem egyszerűen egy gép által kiadott értékelést kaptak.

2. Először egy mesterséges intelligencia-rendszer osztályozta a vizsgálati eredményeket, azokat egy vagy két radiológushoz irányítva, és a gyanús területeket megjelölve, hogy azok figyelmét felhívja rájuk .

3. A szokásos összehasonlítási módszer a kettős értékelés volt: két radiológus vizsgálta át minden szűrővizsgálati felvételt az automatizált segítség nélkül, amely eljárás célja az volt, hogy minden egyes esethez egy második pár szem is rendelkezésre álljon.

4. A változás tehát a munkamódszerben történt, nem csupán a szoftverben .

5. 2021 áprilisa és 2022 decembere között több mint 105 000 nőt osztottak be véletlenszerűen e két szűrővizsgálati eljárás egyikébe, így az összehasonlítás ugyanazon programba bekerült betegeket érintett, nem pedig két egymástól független képgyűjteményt .

6. A véletlenszerű beosztásnak köszönhetően kevésbé volt valószínű, hogy a csoportok közötti különbségek a csoportokba bekerültek összetételét tükrözzék – ez a probléma ugyanis elhomályosíthatja, hogy egy új eljárás valóban megváltoztatta-e az eredményt .

7. Mindkét csoport továbbra is emberi értékelőkre támaszkodott, és mindkettőnél előfordulhatott, hogy rákot nem észleltek .

8. A kérdés az volt, hogy az értékelő figyelmének átirányítása és a kiválasztott vizsgálatoknál az értékelések számának csökkentése megőrzi-e vagy javítja-e a szűrővizsgálati szolgáltatást egészében .

9. Ez egy élesebb kérdés, mint az, hogy egy számítógép képes-e felismerni egy képet .

10. Arra keresi a választ, hogy mikor támaszkodhatnak az emberek ésszerűen egy adott munkamegosztásra egy adott feladat esetében, olyan következményekkel, amelyek az első értékelés után is láthatóak maradnak .

11. Egy korai elemzés megállapította, hogy a mesterséges intelligenciával támogatott eljárás körülbelül 44 százalékkal csökkentette a radiológusok által végzett értékelések számát .

12. Ezek értékelések voltak, nem pedig a szűrés alól mentesített nők vagy a helyettesített radiológusok száma.

13. A különbség azért fontos, mert a rendszer részben úgy takarított meg munkaerőt, hogy eldöntötte, mely képeket vizsgáljon meg egy ember, és melyeket továbbra is kettő, így maga a figyelem elosztása is a beavatkozás részévé vált.

14. Ha a szortírozási szabály figyelmen kívül hagyott egy nehéz esetet, a látszólagos hatékonyságnövekedés egyúttal el is vehette a második esélyt annak felismerésére .

15. A vizsgálatnak ezért olyan eredményre volt szüksége, amely túlmutat a megtakarított perceken vagy a képeken feltüntetett jelöléseken.

16. Az intervallumrákot a szűrővizsgálati ciklusok között, vagy az utolsó tervezett ciklus után két éven belül diagnosztizálják, miután a szűrővizsgálat során nem találták meg; ezeknek az eseteknek a számbavétele összehasonlítja a megnyugtató negatív eredményt a későbbi klinikai valósággal .

17. Ez egy tökéletlen, de következményes módszert kínál arra, hogy megkérdezzük: mit hagyott ki a szűrővizsgálati folyamat?

18. A 2026-ban közzétett eredmények szerint az intervallumrákok előfordulási aránya az AI-támogatott csoportban 1,55/1000 nő, a standard csoportban pedig 1,76/1000 volt.

19. A megfigyelt alacsonyabb arány az új eljárás mellett szólt, de a különbséget övező bizonytalanság miatt – a számok kedvező irányultsága ellenére – nem állapítható meg, hogy ez a mutató tekintetében az új eljárás felsőbbrendű lenne.

20. A vizsgálat teljesítette az előre meghatározott nem-alacsonyabb hatékonysági tesztet: a konfidencia-intervallum felső határa legfeljebb 18 százalékos relatív növekedést engedélyezett, ami a korábban meghatározott 20 százalékos határ alatt maradt.

21. Ez egy korlátozott állításra utal, nem pedig garanciát jelent a kimaradt rákos megbetegedések ellen.

22. Az érzékenység – azaz a később felfedezett rákok helyett a szűréssel azonosított rákok aránya – 80,5 százalék volt a mesterséges intelligencia támogatásával, és 73,8 százalék a hagyományos kettős értékelés esetén; ezt a különbséget a tanulmány statisztikailag is igazolta.

23. A specifitás – azaz a rákmentes vizsgálatok aránya, amelyeket helyesen negatívnak minősítettek – mindkét csoportban 98,5 százalék volt.

24. Ezek az adatok egy hasznos kombinációt mutatnak: a vizsgálatban számba vett rákos megbetegedések közül többet szűrés során fedeztek fel anélkül, hogy a specifitás mérhető csökkenése történt volna, ami azt jelentette volna, hogy több rákmentes nőt kezeltek volna gyanús esetként .

25. Ezek az adatok nem bizonyítják, hogy a rendszer csökkentette volna a halálozást, kiküszöbölte volna a túldiagnosztizálást, vagy biztonságosabbá tette volna minden egyes döntést .

26. A vizsgálat nem tudja elkülöníteni a detektálási küszöb hatását attól a hatástól, hogy egyes képeket egy, másokat pedig két értékelőnek továbbítottak, mivel mindkét változás együttesen működött a tesztelt eljárásban .

27. A bizonyíték egysége az az eljárás, amellyel a betegek ténylegesen találkoztak .

28. Pontosan ezért értékes a tanulmány a bizalomról való gondolkodás szempontjából: egy szűrőprogram nem izoláltan alkalmaz egy algoritmust, hanem beépíti azt az emberi cselekvések sorozatába.

29. A megfelelő mértékű bizalom attól függ, hogy az adott sorozat bizonyíthatóan mit ér el .

30. Attól is függ, hogy a megnyugtató eredmény után észlelhetők-e a hibák .

31. A szűrés során egy hamis negatív eredmény csak akkor válhat láthatóvá, ha később rákot diagnosztizálnak, míg egy ártalmatlan kép kivizsgálására irányuló felszólítás azonnali további vizsgálatokhoz vezethet .

32. Ezeknek a hibáknak eltérő időbeli lefolyása van, és eltérő költségekkel járnak az érintett nők számára.

33. Egyetlen pontossági érték nem árulja el az értelmezőnek, hogy melyik kockázatot fogadták el.

34. A „kalibrált bizalom” kifejezés azt jelenti, hogy a bizalom ott növekszik, ahol a rendszer kiérdemelte, és ott csökken, ahol a rendszer teljesítménye, a rendelkezésre álló bizonyítékok vagy a tét nem támasztja alá.

35. A kalibrálás nem a radiológus személyiségjegye.

36. Ez egy feladat, egy eszköz, egy kijelző, egy emberi munkafolyamat és a visszajelzés közötti kapcsolat, amely feltárja, hogy együttes ítéletük helyes volt-e, különösen akkor, ha a hibák csak az azonnali döntés meghozatala után derülnek ki .

37. Még egy rendkívül pontos rendszer is téves bizalomra adhat okot, ha hallgatását annak bizonyítékaként értelmezik, hogy nincs semmi baj.

38. A képen lévő jelölés éppen ellenkező problémát okozhat: olyan erősen vonzza a figyelmet, hogy más bizonyítékok túl kevés súlyt kapnak .

39. A svéd kísérlet az adott elrendezés következményeit mérte fel; nem tette semmilyen veszélyt eltűnővé minden jövőbeli klinikán .

40. Laboratóriumi kutatások azt mutatják, hogy ugyanaz a logika hogyan bukhat meg egy teljesen más környezetben.

41. Linda Skitka, Kathleen Mosier és Mark Burdick olyan embereket vizsgáltak, akik számítógépes figyelemmel kísérés és ajánlások mellett szimulált repülési feladatot hajtottak végre.

42. Amikor az automatizált segédrendszer nem jelezte a problémát, egyes résztvevők elmulasztottak olyan eseményeket, amelyek egyébként észlelhetők lettek volna; a hiányzó figyelmeztetés okot adott arra, hogy ne vizsgálódjanak tovább.

43. Ezek mulasztási hibák voltak .

44. Máskor a résztvevők hibás tanácsokat követtek, annak ellenére, hogy érvényes, ellentmondó jelzések voltak láthatók a kijelzőn, ami azt mutatja, hogy a helyes információ jelenléte nem garantálja annak felhasználását.

45. Ezek cselekvési hibák voltak: a segédeszköz nem csupán nem nyújtott segítséget, hanem elterelte a figyelmet a jobb információkról .

46. Az egyik esetben az üres riasztási csatorna kevésbé láthatóvá teszi a valódi zavarokat .

47. A másikban a kifejezett utasítás túl nagy tekintélyt nyer.

48. Ezek olyan mechanizmusok, amelyeket ellenőrzött szimulációban figyeltek meg, nem pedig valós balesetek összesítéséből vagy a mellszűrés kockázatának méréséből.

49. Az összehasonlítás azért hasznos, mert rámutat arra, hol csúszhat át a bizalom egy tesztelt funkcióból egy teszteletlen feltételezésbe a hallgatásról vagy a tanácsadásról .

50. A számítógép üzenete megváltoztatja, amit a kezelő ellenőriz, néha jobban, mint amennyire a mögöttes bizonyítékot megváltoztatja .

51. Ha mindkét reakciót lustaságnak neveznénk, az elrejtené a tervezési problémát.

52. Több folyamat figyelemmel kísérése időnyomás alatt felemészti a figyelmet, és egy általában helyes segédeszköz pontosan abban a pillanatban teheti feleslegessé a független ellenőrzést, amikor egy kivétel számít.

53. Az ellentmondás jelen lehet a képernyőn, mégis nehezen használható .

54. Elhelyezkedése, egyértelműsége és időzítése befolyásolja, hogy versenyképes-e egy kiemelt automatizált ajánlással .

55. Kapcsolódó repülési feladatokkal kapcsolatos kísérletekben egy második személy bevonása vagy pusztán az, hogy a résztvevőket arra kérték, ellenőrizzék a segédeszközt, nem szüntette meg megbízhatóan ezeket a hibákat, amelyek ezeknek a látszólag egyszerű biztonsági intézkedéseknek ellenére is fennmaradtak .

56. Ez a megállapítás nem teszi feleslegessé a képzést; csupán azt jelenti, hogy a homályos utasítások nem elegendő ellenőrzési eszközök .

57. Az operátoroknak meg kell tanulniuk, milyen hibákat követhet el a segédeszköz, hol jelennek meg független bizonyítékok, és milyen megfigyelhető körülmények indokolják a második ellenőrzést, amíg még van idő a szükséges intézkedésre .

58. A képzésnek meg kell felelnie annak a feladatnak, amelyet a résztvevők ténylegesen végrehajtanak .

59. Ellenkező esetben a „legyen éber” felszólítás olyan kötelezettséget ró a felhasználóra, anélkül, hogy működőképes módszert biztosítana a gép által kihagyott elemek észlelésére.

60. A szűrőteremben tehát a kiemelt terület csupán egy bizonyíték a sok közül .

61. A kép továbbra is a radiológus rendelkezésére áll, akinek feladata eldönteni, hogy egy látható jellemző figyelmet érdemel-e akkor is, ha mellette nem jelenik meg gépi jelölés, és hogy egy jelölés valódi aggodalomra ad-e okot.

62. Ez a megkülönböztetés egy hosszú vizsgálatsorozat során egyre nehezebbé válik.

63. A csend megnyugtató jelzésként kezdhet működni, ha a rendszer már a legtöbb képet átnézte, és korábbi riasztásai gyakran hasznosnak bizonyultak .

64. Egy független jel pontosan akkor értékes, ha eltérő véleményt fogalmazhat meg.

65. Ha egy második olvasó csupán azt a területet keresi, amelyet a modell bekeretezett, akkor a két névleges olvasat egy közös figyelmi vonalat jelenthet, így a kép jelöletlen részei nem kerülnek alaposabb vizsgálat alá.

66. A kettős olvasás értéke attól függ, hogy mit vesz észre az egyes olvasók anélkül, hogy a másik vakfoltjait is figyelembe vennék, ezért a megállapítások feltárásának sorrendje ugyanolyan fontos lehet, mint a résztvevők száma.

67. Egy jelölés segíthet anélkül, hogy minden megjelölés nélküli területet rangsorolna .

68. A jó tervezésnek lehetővé kell tennie ezeket a megkülönböztetéseket a mindennapi munka során, amikor sok kép vár felülvizsgálatra, és az olvasónak gyorsan el kell döntenie, hogy egy automatizált jelzés mikor érdemel figyelmet, és mikor nem.

69. A kísérlet során elért 44 százalékos munkaterhelés-csökkenés operatívvá teszi ezt a kérdést.

70. Amikor olvasási kapacitást takarítanak meg, egyes vizsgálatok már nem részesülnek ugyanannyi független emberi ellenőrzésben, mint korábban, annak ellenére, hogy minden nő továbbra is megkapja a szűrővizsgálati eredményt, és a megnyugtató eredmény alapján cselekedhet .

71. Ez indokolt kompromisszum lehet, ha a kombinált folyamat elég jól teljesít, különösen ott, ahol a szűkös olvasási időt másra lehetne fordítani.

72. Ez továbbra is olyan csere, amelynek költségeit nem lehet kizárólag a munkaerő-megtakarításból levezetni .

73. Azok a nők, akiknél a rák a negatív szűrővizsgálat után jelentkezik, különösen fontosak az értékelés szempontjából, mivel eseteik olyan hibákat tárnak fel, amelyeket az első értékelés nem tudott magáról jelenteni .

74. Ezen esetek áttekintése rávilágíthat arra, hogy egy gyanús jel hiányzott-e, jelen volt-e, de nehezen észrevehető, megjelölve volt-e, de figyelmen kívül hagyták, vagy egyáltalán nem jelölték meg, így a későbbi diagnózis információt nyújt egy korábbi döntésről .

75. Minden egyes mintázat más-más korrekciót igényel.

76. Egy továbbfejlesztett detektor az egyik esetben segíthet, míg egy megváltozott kijelzés vagy egy másik útválasztási szabály egy másik esetben jelentősebb lehet.

77. Ha minden elmulasztást úgy kezelünk, mintha az ember nem bízott volna a modellben, akkor a munkafolyamat diagnózisát összetévesztenénk a személyiségre vonatkozó ítélettel.

78. Az automatizálás iránti túlzott óvatosság saját veszteségeket okoz.

79. Berkeley Dietvorst, Joseph Simmons és Cade Massey olyan embereket vizsgáltak, akik a saját előrejelzéseik és egy algoritmus előrejelzései között kellett választaniuk.

80. Miután látták, hogy az algoritmus hibázik, a résztvevők kevésbé voltak hajlandók használni azt, még akkor is, ha a megfigyelt algoritmus jobban teljesített, mint az emberi alternatíva – ez az összehasonlítás a kísérlet során a rendelkezésükre állt.

81. A látható hiba nagyobb súllyal esett latba, mint a teljes teljesítmény összehasonlítása .

82. Ez az alulbizalom, amikor a bizonyítékok a modell mellett szólnak.

83. Ez nem általános irányelv arra, hogy mindig azt a modellt részesítsük előnyben, amely átlagosan felülmúlja az embert .

84. A kísérlet résztvevői egy meghatározott előrejelzési feladattal szembesültek, olyan kimenetelekkel és ösztönzőkkel, amelyek nem vihetők át teljes egészükben egy klinikára vagy pilótafülkébe, ahol a hibákat nehezebb lehet számba venni, és következményeik is sokkal kevésbé hasonlóak .

85. Ott egy ritka hiba olyan következménnyel járhat, amelyet az átlagos pontszám elrejt.

86. A kísérlet inkább egy olyan kérdést vet fel, amelyet bármely döntéshozó feltehet: mi számítana elfogadható hibaaránynak ebben a konkrét alkalmazásban, és hogyan teljesít a rendelkezésre álló alternatíva?

87. Az emberi előrejelzések is tévedhetnek, de hibáik kevésbé tűnnek a módszer ellen szóló bizonyítéknak.

88. Ezzel szemben egy algoritmus hibája úgy tűnhet, mintha megszegné a mechanikus következetesség ígéretét, amit egyetlen ésszerű értékelés sem tett soha.

89. Ez az aszimmetria oda vezethet, hogy az emberek egy szembetűnő kudarc után elfordulnak egy hasznos segédeszköztől, miközben továbbra is elnézik a kevésbé látható emberi hibákat, még akkor is, ha a két módszer tisztességes összehasonlítása a segédeszköz mellett szól .

90. A kutatók később azt találták, hogy a résztvevők gyakrabban használták a nem tökéletes előrejelző algoritmust, ha akár csak kis mértékben is módosíthatták annak előrejelzéseit .

91. Ez az eredmény nem igazolja minden esetben a saját belátás szerinti szerkesztést.

92. Egy módosítás növelheti a modellhez fordulás hajlandóságát, ugyanakkor új hibaforrást is bevezethet.

93. Hasznosságát a ténylegesen meghozott döntések alapján kell tesztelni, beleértve azokat is, amelyeket a felhasználó szerkesztései módosítottak, nem pedig abból kiindulva, hogy a kezelő mennyire elégedett a szerkesztések végzése közben .

94. A túlzott bizalom és az alulbecsült bizalom akár egyazon munkahelyen is egymás mellett létezhet.

95. Előfordulhat, hogy valaki figyelmen kívül hagyja az algoritmus általános ajánlását, ugyanakkor egy adott numerikus pontszámot pontosabbnak tekint, mint amit a bizonyítékok indokolnának .

96. Másvalaki viszont követheti a feltűnő riasztást, miközben figyelmen kívül hagyja annak a lehetőségét, hogy a meg nem jelölt esetekben is előfordulhat a betegség.

97. A hiba iránya attól függ, hogyan jelenik meg az információ, mit gondol a felhasználó, hogy az mit jelent, és hogy a környező munkakörnyezetben elég könnyű-e időben megtalálni az ellentmondó bizonyítékokat.

98. A munkaterhelés is számít: ha kevés az idő, egy megbízható segédeszköz tehermentesítheti a figyelmet, míg a megbízhatatlan riasztások áradata éppen azt a figyelmet emésztheti fel, amelyre a független ellenőrzésekhez szükség van .

99. A gyakoriság azért fontos, mert egy ritka hiba esetében nehéz lehet első kézből tanulni a tapasztalatból .

100. A következmények azért fontosak, mert az elmulasztott esetek és a felesleges utánkövetés közötti elfogadható egyensúly klinikai és emberi megítélés kérdése, nem pedig kizárólag a modell pontosságából adódó tulajdonság .

101. A lényeg nem az, hogy a felhasználók minden kimenetet egyformán gyanúsnak tekintsék .

102. Hanem az, hogy minden bizalmi cselekményt összekapcsoljunk az adott kimenet szerepére vonatkozó bizonyítékokkal, valamint egy megvalósítható módszerrel, amellyel felfedezhető, ha az meghibásodik .

103. Egy hasznos hibaüzenet azonosítja, mit hagyott ki a rendszer vagy mit jelölt meg tévesen, a hiba körülményeit, valamint azt, hogy volt-e az embernek használható lehetősége észrevenni azt.

104. Ha csak a végső diagnózist vennénk figyelembe, elszalasztanánk a lehetőséget, hogy megkülönböztessük az észlelési hibát az irányítás vagy a válaszadás hibájától – ezek a megkülönböztetések pedig meghatározzák, hogy az eljárás mely részét kell megváltoztatni.

105. Egy független ellenőrző jelnek elég jól láthatónak kell maradnia ahhoz, hogy megkérdőjelezze a segédeszközt.

106. Egy repülési kijelzőn ez azt jelentheti, hogy a jelzés nem ugyanabból a hibás ajánlásból származik; szűrés során pedig azt jelentheti, hogy egy emberi értékelés vagy későbbi klinikai információ, amelyet a modell pontszáma nem szűr ki.

107. A kétszer értelmezett esetekből álló minták – beleértve azokat is, amelyeket a modell alacsony kockázatúnak tekint – alkalmasak annak vizsgálatára, hogy a második értelmezések számának csökkentése elrejti-e azokat a téves észlelési mintákat, amelyek soha nem jelennek meg a már különös figyelmet kapó, magas kockázatú képek között.

108. A mintának elég nagynak és célzottnak kell lennie a vizsgált hibák szempontjából, mivel néhány egyszerű eset alig nyújtana megnyugvást a ritka, súlyos következményekkel járó hibák tekintetében .

109. A szűrővizsgálati körök közötti időközök további ellenőrzést nyújtanak, bár eredményeik lassan érkeznek, és nem orvosolhatják a már érintett nő esetében elmulasztott diagnózist.

110. A visszacsatolás ezért szükséges, de nem helyettesíti az első értékelés során tanúsított gondosságot.

111. A képzésnek fel kell tárnia a segédeszköz ismert hibamódjait, és lehetővé kell tennie az értékelők számára, hogy gyakorolják a gép jelzése és egy független jelzés közötti eltérés feloldását.

112. Emellett meg kell magyaráznia a teljesítményre vonatkozó állítások mögött álló alapszázalékokat és nevezőket is, hogy egy feltűnő hiba ne törölje ki a több ezer helyes döntést, vagy egy kedvező átlag ne rejtsen el a legfontosabb hibákat.

113. Ezek a biztonsági intézkedések a megtakarított munkaerő egy részét felemésztik.

114. Ezt a költséget figyelembe kell venni az összehasonlításban, mert a rendszer biztonságához hozzátartozik az a munka is, amely a rendszer határainak ellenőrzéséhez szükséges.

115. A svéd vizsgálat meggyőzőbb bizonyítékot szolgáltat, mint a lenyűgöző képek bemutatása: teljes szűrővizsgálati eljárásokat hasonlított össze, és elég hosszú ideig követte a nőket ahhoz, hogy az intervallumrákokat is számba vehesse.

116. Ugyanakkor a kedvező átlagértékek a vizsgált rendszerhez, populációhoz, értékelőkhöz és megfigyelési időszakhoz tartoznak, nem pedig automatikusan minden olyan helyszínhez, amely hasonló szoftvert telepít eltérő körülmények között, vagy megváltoztatja az emberi értékelések arányát .

117. A használat elterjedésével az a lényeges kérdés, hogy a berendezések, a betegek, a személyzet vagy a gyakorlat változásai megváltoztatják-e azt a hibamintát, amelyet az eredeti vizsgálat mért.

118. Egy eljárás bizonyos esetekben megbízhatónak bizonyulhat, míg más esetekben továbbra is két értékelőre van szükség.

119. A bizalom döntő próbája nem az, hogy a modell képes-e rákot felismerni, hanem az, hogy a szűrővizsgálati szolgálat képes-e felismerni azokat a rákos elváltozásokat, amelyeket saját figyelmének elosztása miatt figyelmen kívül hagy .

120. A megjelölés nélküli kép és a későbbi diagnózis továbbra is a bizonyíték részét képezik.

(aufklappen)német

1. In der schwedischen MASAI-Studie wurde eine Mammographie nicht einfach von einer Maschine bewertet.

2. Ein System mit künstlicher Intelligenz sortierte die Untersuchung zunächst, leitete sie entweder an einen oder an zwei Radiologen weiter und markierte verdächtige Bereiche, auf die diese besonders achten sollten .

3. Der übliche Vergleichsmaßstab war die Doppelbefundung: Zwei Radiologen untersuchten jedes Screening-Bild ohne diese automatisierte Hilfe – ein Verfahren, das dafür sorgen sollte, dass für jeden Fall ein zweites Paar Augen zur Verfügung stand.

4. Die Veränderung betraf daher die Arbeitsweise und nicht lediglich die Software .

5. Zwischen April 2021 und Dezember 2022 wurden mehr als 105.000 Frauen nach dem Zufallsprinzip einem dieser beiden Screening-Verfahren zugewiesen, sodass der Vergleich Patienten betraf, die am selben Programm teilnahmen, und nicht zwei voneinander unabhängige Bildersammlungen .

6. Durch die zufällige Zuordnung war es weniger wahrscheinlich, dass Unterschiede zwischen den Gruppen darauf zurückzuführen waren, wer ihnen zugeordnet wurde – ein Problem, das verschleiern kann, ob ein neues Verfahren das Ergebnis tatsächlich verändert hat .

7. Beide Gruppen waren weiterhin auf menschliche Befunder angewiesen, und in beiden konnten Krebsfälle übersehen werden .

8. Die Frage war, ob die Umlenkung der Aufmerksamkeit eines Befunders und die Verringerung der Anzahl der Befundungen bei ausgewählten Untersuchungen den Screening-Service insgesamt erhalten oder verbessern würde .

9. Das ist eine pointiertere Frage als die, ob ein Computer ein Bild erkennen kann.

10. Sie fragt danach, wann Menschen sich bei einer bestimmten Aufgabe vernünftigerweise auf eine bestimmte Arbeitsteilung verlassen können, deren Folgen auch nach der ersten Befundung noch sichtbar bleiben.

11. Eine frühe Analyse ergab, dass das KI-gestützte Verfahren die Anzahl der radiologischen Befundungen um etwa 44 Prozent reduzierte.

12. Dabei handelte es sich um Befundungen, nicht um Frauen, denen die Vorsorgeuntersuchung erspart blieb, oder um Radiologen, die ersetzt wurden.

13. Der Unterschied ist von Bedeutung, da das System Arbeitsaufwand teilweise dadurch einsparte, dass es entschied, welche Bilder eine menschliche Befundung erhielten und welche weiterhin zwei – wodurch die Zuweisung der Aufmerksamkeit selbst Teil der Intervention wurde.

14. Wenn die Sortierregel einen schwierigen Fall übersah, könnte der scheinbare Effizienzgewinn auch eine zweite Chance zunichte machen, diesen Fall zu erkennen .

15. Die Studie benötigte daher ein Ergebnis, das über eingesparte Minuten oder Markierungen auf Bildern hinausging.

16. Ein Intervallkarzinom wird zwischen zwei Vorsorgeuntersuchungen oder innerhalb von zwei Jahren nach der letzten planmäßigen Untersuchung diagnostiziert, nachdem es bei der Vorsorgeuntersuchung nicht festgestellt wurde; die Zählung dieser Fälle vergleicht das beruhigende negative Ergebnis mit der späteren klinischen Realität.

17. Dies bietet eine zwar unvollkommene, aber aussagekräftige Möglichkeit, zu ergründen, was der Vorsorgeprozess übersehen hat.

18. In den 2026 veröffentlichten Ergebnissen traten Intervallkarzinome mit einer Rate von 1,55 pro 1.000 Frauen in der KI-gestützten Gruppe und 1,76 pro 1.000 in der Standardgruppe auf.

19. Die niedrigere beobachtete Rate sprach für das neue Verfahren, doch die Unsicherheit hinsichtlich dieses Unterschieds ließ trotz der vielversprechenden Tendenz der Zahlen keinen Schluss zu, dass es in dieser Hinsicht überlegen war.

20. Die Studie erfüllte ihren vorab festgelegten Nichtunterlegenheitstest: Die Obergrenze ihres Konfidenzintervalls ließ einen relativen Anstieg von bis zu 18 Prozent zu, was unter der im Voraus festgelegten Marge von 20 Prozent lag.

21. Dies ist ein Beleg für eine begrenzte Aussage, keine Garantie gegen übersehene Krebserkrankungen.

22. Die Sensitivität, also der Anteil der Krebserkrankungen, die durch das Screening erkannt und nicht erst später entdeckt wurden, betrug 80,5 Prozent bei KI-Unterstützung und 73,8 Prozent bei der herkömmlichen doppelten Befundung – ein Unterschied, den die Studie statistisch nachweisen konnte.

23. Die Spezifität, also der Anteil der krebsfreien Untersuchungen, die korrekt als negativ eingestuft wurden, lag in beiden Gruppen bei 98,5 Prozent.

24. Diese Zahlen beschreiben eine nützliche Kombination: Ein größerer Anteil der in der Studie erfassten Krebserkrankungen wurde im Rahmen der Vorsorgeuntersuchung entdeckt, ohne dass dabei ein messbarer Verlust an Spezifität auftrat, was bedeutet hätte, dass mehr krebsfreie Frauen als verdächtig eingestuft worden wären.

25. Sie zeigen jedoch nicht, dass das System die Zahl der Todesfälle verringert, Überdiagnosen beseitigt oder jede einzelne Beurteilung sicherer gemacht hat.

26. Ebenso wenig kann die Studie die Wirkung einer Erkennungsmarkierung von der Wirkung der Weiterleitung einiger Bilder an einen Befunder und anderer an zwei Befunder trennen, da beide Änderungen im getesteten Verfahren zusammenwirkten.

27. Ihre Evidenzgrundlage ist das Verfahren, dem die Patientinnen tatsächlich ausgesetzt waren.

28. Genau deshalb ist die Studie für Überlegungen zum Thema Vertrauen wertvoll: Ein Vorsorgeprogramm wendet einen Algorithmus nicht isoliert an, sondern bettet ihn in eine Abfolge menschlicher Handlungen ein.

29. Das richtige Maß an Vertrauen hängt davon ab, was diese Abfolge nachweislich bewirkt .

30. Es hängt auch davon ab, ob Fehler nach einem beruhigenden Ergebnis bemerkt werden können .

31. Bei der Vorsorgeuntersuchung wird ein falsch-negatives Ergebnis möglicherweise erst sichtbar, wenn später eine Krebserkrankung diagnostiziert wird, während eine Aufforderung zur Untersuchung eines harmlosen Befunds zu sofortigen zusätzlichen Untersuchungen führen kann .

32. Diese Fehler verlaufen zeitlich unterschiedlich und verursachen unterschiedliche Kosten für die betroffenen Frauen.

33. Ein einzelner Genauigkeitswert kann einem Befunder nicht sagen, welches Risiko akzeptiert wurde .

34. Der Begriff „kalibriertes Vertrauen“ bedeutet, dass das Vertrauen dort steigt, wo ein System es sich verdient hat, und dort sinkt, wo seine Leistung, die verfügbaren Erkenntnisse oder die Tragweite dies nicht rechtfertigen.

35. Kalibrierung ist kein Persönlichkeitsmerkmal eines Radiologen .

36. Es handelt sich um eine Beziehung zwischen einer Aufgabe, einem Gerät, einer Anzeige, einem menschlichen Arbeitsablauf und dem Feedback, das aufzeigt, ob ihre kombinierten Beurteilungen richtig waren – insbesondere dort, wo Fehler erst nach der unmittelbaren Entscheidung zutage treten .

37. Selbst ein hochpräzises System kann zu unangebrachtem Vertrauen verleiten, wenn sein Schweigen als Beweis dafür gewertet wird, dass alles in Ordnung ist.

38. Eine Markierung auf einem Bild kann das gegenteilige Problem mit sich bringen, indem sie die Aufmerksamkeit so stark auf sich zieht, dass anderen Hinweisen zu wenig Gewicht beigemessen wird.

39. Die schwedische Studie untersuchte die Folgen dieser speziellen Anordnung; sie hat keine der beiden Gefahren in jeder zukünftigen Klinik beseitigt .

40. Laboruntersuchungen zeigen, wie dieselbe Logik in einem ganz anderen Umfeld versagen kann.

41. Linda Skitka, Kathleen Mosier und Mark Burdick untersuchten Personen, die eine simulierte Flugaufgabe unter computergestützter Überwachung und mit Empfehlungen durchführten.

42. Wenn die automatisierte Hilfe ein Problem nicht meldete, übersahen einige Teilnehmer Ereignisse, die ansonsten erkennbar gewesen wären; die fehlende Warnung war zu einem Grund geworden, nicht weiter nachzuschauen.

43. Dies waren Unterlassungsfehler.

44. In anderen Fällen folgten die Teilnehmer fehlerhaften Ratschlägen, obwohl auf dem Display gültige, widersprüchliche Hinweise verfügbar waren, was zeigt, dass das Vorhandensein korrekter Informationen deren Nutzung nicht gewährleistet.

45. Das waren Aktionsfehler: Die Hilfe versagte nicht nur, sondern lenkte das Handeln von besseren Informationen ab.

46. In einem Muster macht ein leerer Warnkanal eine tatsächliche Störung weniger sichtbar.

47. Im anderen gewinnt eine explizite Anweisung zu viel Autorität.

48. Dies sind Mechanismen, die in einer kontrollierten Simulation beobachtet wurden, keine Aufstellung realer Abstürze oder ein gemessenes Risiko für die Brustkrebsvorsorge.

49. Der Vergleich ist nützlich, weil er aufzeigt, wo Vertrauen von einer getesteten Funktion auf eine ungeprüfte Annahme über Schweigen oder Ratschläge übergehen kann .

50. Die Meldung des Computers verändert, was der Bediener überprüft – manchmal stärker, als sie die zugrunde liegenden Beweise verändert .

51. Beide Reaktionen als „Faulheit“ zu bezeichnen, würde das Designproblem verschleiern.

52. Die Überwachung mehrerer Datenströme unter Zeitdruck beansprucht die Aufmerksamkeit, und eine Hilfe, die normalerweise richtig liegt, kann eine unabhängige Überprüfung genau in dem Moment überflüssig erscheinen lassen, in dem eine Ausnahme von Bedeutung ist.

53. Der Widerspruch mag zwar auf dem Bildschirm vorhanden sein, aber dennoch schwer zu nutzen sein .

54. Seine Position, Klarheit und der Zeitpunkt beeinflussen, ob er mit einer auffälligen automatisierten Empfehlung konkurrieren kann.

55. In verwandten Experimenten zu Flugaufgaben konnten diese Fehler nicht zuverlässig beseitigt werden, indem eine zweite Person hinzugezogen oder die Teilnehmer lediglich angewiesen wurden, die Hilfe zu überprüfen; die Fehler blieben trotz dieser scheinbar einfachen Sicherheitsvorkehrungen bestehen.

56. Diese Erkenntnis macht das Training nicht nutzlos; sie macht vage Anweisungen zu einer unzureichenden Kontrollmaßnahme .

57. Die Bediener müssen lernen, welche Fehler die Hilfsfunktion machen kann, wo unabhängige Hinweise erscheinen und welcher beobachtbare Zustand eine zweite Überprüfung erfordert, solange noch Zeit bleibt, darauf zu reagieren .

58. Das Training muss auf die Aufgabe abgestimmt sein, die sie tatsächlich ausführen werden.

59. Andernfalls fügt die Aufforderung, „wachsam zu bleiben“, eine zusätzliche Pflicht hinzu, ohne eine praktikable Möglichkeit zu bieten, zu erkennen, was die Maschine übersehen hat .

60. Zurück im Befundungsraum ist ein hervorgehobener Bereich daher nur ein Anhaltspunkt .

61. Das Bild steht dem Radiologen weiterhin zur Verfügung, zu dessen Aufgabe es gehört, zu entscheiden, ob ein sichtbares Merkmal Beachtung verdient, auch wenn keine maschinengenerierte Markierung daneben erscheint, und ob eine Markierung auf ein echtes Problem hinweist.

62. Diese Unterscheidung wird bei einer langen Reihe von Untersuchungen immer schwieriger.

63. Schweigen kann als Beruhigung wirken, wenn das System bereits die meisten Bilder sortiert hat und sich seine früheren Warnmeldungen oft als nützlich erwiesen haben.

64. Ein unabhängiges Signal hat gerade dann Wert, wenn es abweichen kann.

65. Wenn ein zweiter Befunder lediglich nach dem Bereich sucht, den das Modell eingekreist hat, können zwei nominelle Befunde auf eine gemeinsame Aufmerksamkeitsebene hinauslaufen, wodurch unmarkierte Teile des Bildes nicht besser untersucht werden.

66. Der Wert der doppelten Begutachtung hängt davon ab, was jeder Begutachter erkennen kann, ohne auf die blinden Flecken des anderen zurückzugreifen; deshalb kann die Reihenfolge, in der Befunde offengelegt werden, ebenso wichtig sein wie die Anzahl der Begutachter.

67. Eine Markierung kann hilfreich sein, ohne jeden nicht markierten Bereich zu bewerten .

68. Ein gutes Design muss diese Unterscheidungen im Arbeitsalltag ermöglichen, wenn viele Bilder auf die Begutachtung warten und der Begutachter schnell entscheiden muss, wo ein automatisierter Hinweis Beachtung verdient und wo nicht.

69. Die im Rahmen der Studie erzielte Arbeitsentlastung von 44 Prozent macht diese Frage praxisrelevant.

70. Wenn Auswertungskapazitäten eingespart werden, erhalten manche Untersuchungen nicht mehr die gleiche Anzahl unabhängiger menschlicher Begutachtungen wie zuvor, auch wenn jede Frau weiterhin ein Screening-Ergebnis erhält und sich auf dessen beruhigende Wirkung verlassen kann .

71. Das kann ein gerechtfertigter Kompromiss sein, wenn der kombinierte Prozess gut genug funktioniert, insbesondere wenn die knappe Auswertungszeit anderweitig genutzt werden könnte.

72. Es handelt sich nach wie vor um einen Austausch, dessen Kosten sich nicht allein aus den Einsparungen bei den Personalkosten ableiten lassen.

73. Die Frauen, bei denen nach einem negativen Screening eine Krebserkrankung auftritt, sind für die Bewertung besonders wichtig, da ihre Fälle Mängel aufdecken, die bei der ersten Befundung nicht erkannt werden konnten.

74. Die Überprüfung dieser Fälle kann zeigen, ob ein verdächtiges Merkmal fehlte, zwar vorhanden, aber schwer zu erkennen war, markiert und außer Acht gelassen wurde oder gar nicht erst markiert wurde, sodass eine spätere Diagnose Aufschluss über eine frühere Entscheidung gibt .

75. Jedes Muster erfordert eine andere Korrektur.

76. Ein verbesserter Detektor könnte bei dem einen helfen, während bei einem anderen eine geänderte Anzeige oder eine andere Weiterleitungsregel entscheidender sein könnte.

77. Jeden Fehlbefund als Beweis dafür zu betrachten, dass der Mensch dem Modell nicht vertraut hat, würde eine Diagnose des Arbeitsablaufs mit einer Beurteilung des Temperaments verwechseln.

78. Übermäßige Vorsicht gegenüber der Automatisierung verursacht ihre eigenen Verluste.

79. Berkeley Dietvorst, Joseph Simmons und Cade Massey untersuchten Menschen, die zwischen ihren eigenen Prognosen und denen eines Algorithmus wählen mussten.

80. Nachdem die Teilnehmer gesehen hatten, dass der Algorithmus Fehler machte, waren sie weniger bereit, ihn zu nutzen – selbst wenn der beobachtete Algorithmus besser abgeschnitten hatte als die menschliche Alternative, ein Vergleich, der ihnen im Experiment zur Verfügung stand.

81. Der sichtbare Fehler hatte mehr Gewicht als der Vergleich der Gesamtleistung.

82. Das ist „Undertrust“, wenn die Beweislage für das Modell spricht.

83. Es handelt sich nicht um eine allgemeine Anweisung, ein Modell immer dann zu bevorzugen, wenn es im Durchschnitt besser abschneidet als ein Mensch.

84. Die Versuchsteilnehmer standen vor einer definierten Prognoseaufgabe mit Ergebnissen und Anreizen, die sich nicht eins zu eins auf eine Klinik oder ein Cockpit übertragen lassen, wo Fehler möglicherweise schwerer zu erfassen sind und weitaus unterschiedliche Folgen haben .

85. Dort kann ein seltener Fehler eine Konsequenz nach sich ziehen, die ein Durchschnittswert verschleiert.

86. Das Experiment wirft stattdessen eine Frage auf, die sich jeder Entscheidungsträger stellen kann: Was würde für diesen speziellen Anwendungsfall als akzeptable Fehlerquote gelten, und wie schneidet die verfügbare Alternative ab?

87. Auch menschliche Prognosen liegen daneben, doch ihre Fehler wirken möglicherweise weniger wie ein Beweis gegen die Methode selbst .

88. Der Fehler eines Algorithmus hingegen kann den Anschein erwecken, ein Versprechen mechanischer Konsistenz zu brechen, das keine fundierte Bewertung jemals abgegeben hat.

89. Diese Asymmetrie kann dazu führen, dass Menschen eine nützliche Hilfe nach einem auffälligen Fehlschlag aufgeben, während sie weniger sichtbare menschliche Fehler weiterhin verzeihen – selbst wenn ein fairer Vergleich der beiden Methoden für die Hilfe spricht .

90. Die Forscher stellten später fest, dass die Teilnehmer einen unvollkommenen Prognosealgorithmus häufiger nutzten, wenn sie selbst kleine Anpassungen an dessen Vorhersagen vornehmen konnten .

91. Dieses Ergebnis rechtfertigt jedoch nicht in jedem Fall eine eigenmächtige Bearbeitung.

92. Eine Anpassung kann die Bereitschaft erhöhen, ein Modell zu konsultieren, führt aber gleichzeitig eine neue Fehlerquelle ein.

93. Seine Nützlichkeit muss anhand der tatsächlich getroffenen Entscheidungen geprüft werden, einschließlich derer, die durch die Bearbeitungen des Nutzers verändert wurden, und nicht anhand der Zufriedenheit, die der Anwender bei diesen Bearbeitungen empfindet .

94. Übermäßiges Vertrauen und mangelndes Vertrauen können sogar am selben Arbeitsplatz nebeneinander bestehen .

95. Eine Person kann die allgemeine Empfehlung eines Algorithmus ignorieren, aber dennoch eine bestimmte numerische Bewertung als präziser betrachten, als es die Beweislage rechtfertigt.

96. Eine andere Person folgt vielleicht einer auffälligen Warnmeldung, ignoriert dabei jedoch die Möglichkeit, dass auch nicht markierte Fälle noch eine Erkrankung enthalten .

97. Die Richtung des Fehlers hängt davon ab, wie die Informationen dargestellt werden, was der Nutzer glaubt, was sie darstellen, und ob die umgebenden Arbeitsabläufe es leicht genug machen, widersprüchliche Beweise rechtzeitig zu finden.

98. Auch die Arbeitsbelastung spielt eine Rolle: Wenn die Zeit knapp ist, kann eine zuverlässige Hilfe Aufmerksamkeit freisetzen, während ein unzuverlässiger Strom von Warnmeldungen genau die Aufmerksamkeit beanspruchen kann, die für unabhängige Überprüfungen benötigt wird.

99. Die Häufigkeit ist von Bedeutung, da es schwierig sein kann, aus eigener Erfahrung aus einem seltenen Fehler zu lernen.

100. Die Konsequenzen sind von Bedeutung, da das akzeptable Gleichgewicht zwischen übersehenen Fällen und unnötigen Nachuntersuchungen eine klinische und menschliche Beurteilung ist und nicht allein durch die Genauigkeit eines Modells bestimmt wird .

101. Es geht nicht darum, die Nutzer gegenüber jeder Ausgabe gleichermaßen misstrauisch zu machen.

102. Es geht darum, jeden Akt des Vertrauens mit Belegen über die Rolle dieser Ausgabe und mit einer praktikablen Möglichkeit zu verknüpfen, festzustellen, wann sie versagt .

103. Ein nützlicher Fehlerbericht identifiziert, was das System übersehen oder fälschlicherweise markiert hat, die Umstände des Fehlers und ob ein Mensch eine verwertbare Gelegenheit hatte, ihn zu bemerken.

104. Würde man nur die endgültige Diagnose zählen, würde man die Chance verpassen, einen Erkennungsfehler von einem Fehler bei der Weiterleitung oder Reaktion zu unterscheiden – Unterscheidungen, die darüber entscheiden, welcher Teil des Verfahrens geändert werden muss.

105. Ein unabhängiges Kontrollsignal muss sichtbar genug bleiben, um die Hilfsfunktion zu hinterfragen.

106. In einer Fluganzeige kann das eine Anzeige bedeuten, die nicht aus derselben fehlerhaften Empfehlung abgeleitet wurde; bei der Vorsorgeuntersuchung kann es eine menschliche Beurteilung oder spätere klinische Informationen bedeuten, die nicht durch die Bewertung des Modells herausgefiltert werden.

107. Stichproben von doppelt ausgewerteten Fällen, einschließlich solcher, die das Modell als risikoarm einstuft, können prüfen, ob die Reduzierung von Zweitauswertungen ein Muster von Übersehen verbirgt, das bei den bereits besonders genau untersuchten Hochrisikobildern niemals auftreten würde.

108. Die Stichprobe muss groß und für die betreffenden Fehler zielgerichtet genug sein, da eine Handvoll einfacher Fälle wenig Sicherheit hinsichtlich seltener, folgenschwerer Fehler bieten würde.

109. Die Intervalle zwischen den Screening-Runden bieten eine weitere Kontrollmöglichkeit, auch wenn ihre Ergebnisse nur langsam vorliegen und eine übersehene Diagnose bei der bereits betroffenen Frau nicht mehr korrigieren können.

110. Feedback ist daher notwendig, ersetzt jedoch nicht die Sorgfalt bei der Erstauswertung.

111. Die Schulung sollte die bekannten Fehlermodi des Hilfsmittels aufzeigen und es den Auswertern ermöglichen, die Auflösung von Unstimmigkeiten zwischen einem maschinellen Hinweis und einer unabhängigen Indikation zu üben.

112. Sie sollte zudem die Basisraten und Nenner hinter Leistungsangaben erläutern, damit ein auffälliger Fehler nicht Tausende korrekter Entscheidungen zunichte macht oder ein schmeichelhafter Durchschnitt die Fehler verdeckt, auf die es am meisten ankommt.

113. Diese Sicherheitsvorkehrungen verbrauchen einen Teil der eingesparten Arbeitskraft.

114. Diese Kosten müssen in den Vergleich einbezogen werden, da die Sicherheit eines Systems auch den Aufwand umfasst, der erforderlich ist, um seine Grenzen zu überprüfen.

115. Die schwedische Studie liefert stichhaltigere Belege als die Präsentation eindrucksvoller Bilder: Sie verglich vollständige Vorsorgeverfahren und begleitete die Frauen lange genug, um Intervallkarzinome zu erfassen.

116. Doch seine günstigen Durchschnittswerte beziehen sich auf die getestete Konfiguration, Population, die Befunder sowie den Beobachtungszeitraum und gelten nicht automatisch für jede Einrichtung, die ähnliche Software unter anderen Bedingungen einsetzt oder das Verhältnis der manuellen Befundungen verändert .

117. Mit zunehmender Verbreitung stellt sich die entscheidende Frage, ob Veränderungen bei der Ausrüstung, den Patientinnen, der Personalausstattung oder der Praxis das Fehlermuster verändern, das in der ursprünglichen Studie gemessen wurde.

118. Ein Verfahren kann in einigen Fällen Vertrauen gewinnen, während es in anderen Fällen weiterhin zwei Auswerter erfordert.

119. Der entscheidende Test für das Vertrauen ist nicht, ob das Modell einen Krebs erkennen kann, sondern ob der Screening-Dienst erkennen kann, welche Krebserkrankungen durch seine eigene Aufmerksamkeitsverteilung übersehen werden .

120. Das nicht markierte Bild und die spätere Diagnose bleiben Teil der Beweislage.

Dieser Text steht unter CC0 1.0 Universell. Eine Quellenangabe ist nicht erforderlich.
Er darf kostenlos kopiert, verändert, veröffentlicht und auch kommerziell genutzt werden.