modjor.de

4.6 – A benchmarkok mint titkos útjelzők – Benchmarks als heimliche Wegweiser


4.6 – A benchmarkok mint titkos útjelzők – Benchmarks als heimliche Wegweiser


1. Egy angol templom vagy híd kőfalába vésve, gyakran alig magasabban, mint egy ember derékmagassága, egy kis faragott nyíl egy vízszintes horony felé mutat. – In die Steinmauer einer englischen Kirche oder Brücke eingelassen, oft nicht höher als die Hüfthöhe eines Menschen, zeigt ein kleiner, eingemeißelter Pfeil auf eine horizontale Rille.

2. Sok járókelő graffitinek vagy egy kőműves véletlen jelölésének téveszti ezt a szimbólumot. – Viele Passanten halten das Symbol fälschlicherweise für Graffiti oder die zufällige Markierung eines Maurers.

3. Ez egy referenciapont, egy olyan rögzített pont, amelynek magasságát a földmérők határozták meg és rögzítették. – Es handelt sich um einen Vermessungspunkt, einen festen Punkt, dessen Höhe Vermessungsingenieure ermittelt und dokumentiert haben.

4. A név arra a szögvasra utal, amelyet a horonyba illesztve kis „padot” lehetett kialakítani a szintezőrúd számára. – Der Name erinnert an das Winkeleisen, das in die Rille eingesetzt werden konnte, um eine kleine Auflage für einen Nivellierstab zu bilden.

5. Az Ordnance Survey végül mintegy háromnegyedmillió ilyen ponttal sűrítette fel országos szintezőhálózatát, és egy 2020-as ügynökségi útmutató szerint körülbelül félmillió még mindig létezik és használható. – Die Ordnance Survey verdichtete schließlich ihr nationales Nivelliernetz mit rund einer Dreiviertelmillion solcher Markierungen, und ein Leitfaden der Behörde aus dem Jahr 2020 berichtete, dass etwa eine halbe Million davon noch vorhanden und nutzbar sind.

6. Nagy-Britannia szárazföldjén a rögzített magasságaikat e hálózaton keresztül az Ordnance Datum Newlyn-hez kötötték. – Auf dem britischen Festland wurden ihre aufgezeichneten Höhen über dieses Netzwerk an das Ordnance Datum Newlyn gebunden.

7. Ez a referenciapont a 1915 és 1921 között Cornwallban, Newlynben végzett folyamatos árapálymérésekből számított átlagos tengerszintet őrzi, annak ellenére, hogy a tengerszint ott azóta is folyamatosan változik. – Dieser Bezugspunkt bewahrt den mittleren Meeresspiegel, der aus kontinuierlichen Gezeitenmessungen in Newlyn in Cornwall zwischen 1915 und 1921 berechnet wurde, auch wenn sich der Meeresspiegel dort seitdem weiter verändert hat.

8. Néhány távoli sziget más helyi referenciapontokat használ, ami arra emlékeztet, hogy még egy országos referenciarendszernek is vannak határai. – Einige abgelegene Inseln verwenden andere lokale Bezugssysteme, was daran erinnert, dass selbst ein nationales Referenzsystem seine Grenzen hat.

9. Nincs semmi szent Newlynben vagy abban a hat évben. – An Newlyn oder diesen sechs Jahren ist nichts Heiliges.

10. A választás gyakorlatias, indokolt és körülményektől függő volt, mivel más stabil referenciarendszerek is megfeleltek volna. – Die Wahl war praktisch, vertretbar und bedingt, da auch andere stabile Referenzsysteme hätten dienen können.

11. Miután azonban elfogadták, lehetővé tette, hogy egymástól távol és évtizedekkel egymástól elválasztva dolgozó emberek ugyanazokkal a kifejezésekkel írják le a magasságokat. – Nach seiner Einführung ermöglichte es jedoch Menschen, die weit voneinander entfernt und Jahrzehnte auseinander lebten, Höhen mit denselben Begriffen zu beschreiben.

12. A földmérő referenciapontja egy hivatkozási pont volt, nem pedig cél. – Ein Vermessungsreferenzpunkt war ein Bezugspunkt, kein Ziel.

13. Senki sem épített dombot azért, hogy meghaladja azt. – Niemand hat einen Hügel aufgeschüttet, um ihn zu übertreffen.

14. Értéke a stabilitásból, a közös használatból és a szándékosan korlátozott igényből fakadt. – Sein Wert ergab sich aus Stabilität, gemeinsamer Nutzung und einem bewusst begrenzten Anspruch.

15. A modern kutatási referenciaérték megtartja ezt a koordináló funkciót, de általában hozzáad valamit, ami a vágási jelölésnek soha nem volt: egy elvégzendő feladatot és egy javítandó pontszámot. – Der moderne Forschungs-Benchmark behält diese koordinierende Funktion bei, fügt aber in der Regel etwas hinzu, was der Höhenpunkt nie hatte: eine zu erfüllende Aufgabe und eine zu verbessernde Punktzahl.

16. Ez a kiegészítés a passzív hivatkozási pontot lehetséges cselekvési útmutatóvá alakítja. – Diese Ergänzung verwandelt einen passiven Bezugspunkt in einen möglichen Leitfaden für das Handeln.

17. A gépi tanulásban egy referenciaérték általában legalább három olyan választási lehetőséget egyesít, amelyek könnyen összekeverhetők. – Ein Benchmark im maschinellen Lernen verbindet normalerweise mindestens drei Optionen, die leicht miteinander verschmelzen können.

18. Az adatkészlet kiválasztja azokat az eseteket, amelyeken a rendszert tesztelni fogják. – Ein Datensatz wählt die Fälle aus, anhand derer ein System getestet wird.

19. A feladat és az értékelési protokoll meghatározza, hogy a rendszernek mit kell tennie, és milyen feltételek mellett. – Eine Aufgabe und ihr Bewertungsprotokoll legen fest, was das System unter welchen Bedingungen leisten muss.

20. A mérőszám az eredményül kapott teljesítményeket és hibákat egy vagy több számba sűríti. – Eine Metrik fasst die resultierenden Leistungen und Fehler in einer oder mehreren Zahlen zusammen.

21. Az eredménytábla ezután ezeknek a számoknak megfelelően rangsorolhatja a rendszereket, így a összehasonlítás rendkívül gyors és áttekinthető lesz. – Eine Rangliste kann die Systeme dann anhand dieser Zahlen ordnen, wodurch der Vergleich ungewöhnlich schnell und anschaulich wird.

22. Minden komponens valódi intellektuális munkát végez. – Jede Komponente leistet echte intellektuelle Arbeit.

23. Közös adatkészlet nélkül két laboratórium különböző példákon végezhet tesztelést. – Ohne einen gemeinsamen Datensatz könnten zwei Labore Tests an unterschiedlichen Beispielen durchführen.

24. Közös protokoll nélkül eltérő mennyiségű információt vagy segítséget adhatnak a rendszereiknek. – Ohne ein gemeinsames Protokoll könnten sie ihren Systemen unterschiedliche Mengen an Informationen oder Unterstützung zur Verfügung stellen.

25. Közös mérőszám nélkül vitába keveredhetnek abban, hogy egy bizonyos hibatípus fontosabb-e, mint egy másik. – Ohne eine gemeinsame Metrik könnten sie sich darüber uneinig sein, ob eine bestimmte Art von Fehler schwerwiegender ist als eine andere.

26. Minden közzétett eredmény így önmagában megalapozottnak tekinthető, de összehasonlításra szinte használhatatlan. – Jedes veröffentlichte Ergebnis wäre dann für sich genommen zwar vertretbar, für Vergleiche jedoch nahezu unbrauchbar.

27. A közös referenciaérték közös kísérleti nyelvet teremt. – Ein gemeinsamer Benchmark schafft eine gemeinsame experimentelle Sprache.

28. Lehetővé teszi a kutatók számára, hogy reprodukálják a kudarcokat, új módszereket teszteljenek a bevett referenciaértékekhez viszonyítva, és eredményeket gyűjtsenek anélkül, hogy minden módszertani vitát újra fel kellene vetniük. – Er ermöglicht es Forschern, Fehlschläge zu reproduzieren, eine neue Methode anhand etablierter Referenzwerte zu testen und Ergebnisse zu sammeln, anstatt jede methodische Debatte neu zu eröffnen.

29. Felfedheti a túlzott állításokat, mivel egy rendszer, amely a feltalálója bemutatójában kiemelkedő teljesítményt nyújt, most ugyanazokkal az esetekkel kell szembenéznie, mint riválisai. – Er kann übertriebene Behauptungen entlarven, da ein System, das in der Demonstration seines Erfinders glänzt, sich nun denselben Fällen stellen muss wie seine Konkurrenten.

30. A mérés tehát nem a felfedezés ellensége. – Messung ist daher kein Feind der Entdeckung.

31. Számos területen ez az infrastruktúra része, amely lehetővé teszi a kumulatív felfedezéseket. – In vielen Fachgebieten ist sie Teil der Infrastruktur, die kumulative Entdeckungen erst möglich macht.

32. Az információkeresés egy árulkodó korai példát kínál. – Die Informationsgewinnung bietet ein aufschlussreiches frühes Beispiel.

33. Az első Text REtrieval Conference 1992-ben huszonöt résztvevő csoportot hozott össze egy olyan program keretében, amelyet a Nemzeti Szabványügyi és Technológiai Intézet (NIST) és a Védelmi Fejlett Kutatási Projektek Ügynöksége (DARPA) közösen támogatott. – Die erste Text REtrieval Conference im Jahr 1992 brachte 25 teilnehmende Gruppen im Rahmen eines Programms zusammen, das vom National Institute of Standards and Technology und der Defense Advanced Research Projects Agency gemeinsam gefördert wurde.

34. Ahelyett, hogy minden csoport saját dokumentumait és kérdéseit választhatta volna, a program közös gyűjteményeket, témákat, értékelési eljárásokat és relevancia-értékeléseket biztosított. – Anstatt jeder Gruppe zu gestatten, ihre eigenen Dokumente und Fragestellungen auszuwählen, stellte das Programm gemeinsame Sammlungen, Themen, Bewertungsverfahren und Relevanzbeurteilungen zur Verfügung.

35. A kutatók olyan léptékben tudták összehasonlítani a megközelítéseket, amelyet az egyes laboratóriumok egyedül nehezen tudtak volna megvalósítani. – Die Forscher konnten Ansätze in einem Umfang vergleichen, den einzelne Labore allein nur schwer hätten realisieren können.

36. A cél nem csupán egy győztes kihirdetése volt, és a folytatódó TREC-program kifejezetten verseny előtti kutatásként kezeli a gyakorlatot, nem pedig reklámként. – Es ging nicht lediglich darum, einen Sieger zu küren, und das fortlaufende TREC-Programm behandelt die Übung ausdrücklich als vorwettbewerbliche Forschung und nicht als Werbung.

37. Tartós eredményei közé tartoznak az adatkészletek, az értékelések, a benyújtott futtatások és a technikai beszámolók, amelyeket a későbbi kutatók újra megvizsgálhatnak. – Zu seinen dauerhaften Ergebnissen gehören Datensätze, Bewertungen, eingereichte Durchläufe und technische Berichte, die spätere Forscher erneut einsehen können.

38. Egy közös teszt így kiszélesítheti egy terület gyakorlati lehetőségeinek körét azáltal, hogy a korábban drága kísérleteket megfizethetővé és összehasonlíthatóvá teszi. – Ein gemeinsamer Test kann somit den Raum der praktischen Möglichkeiten eines Fachgebiets erweitern, indem er zuvor kostspielige Experimente erschwinglich und vergleichbar macht.

39. Ezenkívül produktívabbá teszi a nézeteltéréseket is, mivel a versengő csoportok végül ugyanazon operatív kérdésről vitáznak. – Er macht auch Meinungsverschiedenheiten produktiver, da konkurrierende Gruppen sich schließlich über dieselbe operative Frage uneinig sind.

40. Az operatív kérdések azonban soha nem azonosak azokkal a tágabb képességekkel, amelyeket képviselni hivatottak. – Operative Fragen sind jedoch niemals identisch mit den umfassenden Fähigkeiten, die sie repräsentieren sollen.

41. A keresés minősége például attól függ, hogy mire van szükségük a felhasználóknak, milyen dokumentumok léteznek, hogyan ítélik meg a relevanciát, és milyen költségekkel jár egy elmulasztott vagy félrevezető eredmény. – Die Suchqualität hängt beispielsweise davon ab, was Nutzer benötigen, welche Dokumente vorhanden sind, wie Relevanz beurteilt wird und welche Kosten sich aus einem fehlenden oder irreführenden Ergebnis ergeben.

42. Ahhoz, hogy egy kísérlet megismételhető legyen, az adatgyűjteménynek és a mérőszámnak ennek a világnak a nagy részét meg kell őriznie. – Eine Sammlung und eine Metrik müssen einen Großteil dieser Welt noch einbeziehen, um ein Experiment wiederholbar zu machen.

43. Az ebből adódó egyszerűsítés megvilágosító lehet anélkül, hogy semleges vagy teljes lenne. – Die daraus resultierende Vereinfachung kann aufschlussreich sein, ohne neutral oder vollständig zu sein.

44. Minden benchmark a probléma tömör elmélete: ezek az esetek, ebben a formátumban bemutatva és ilyen módon pontozva, annak bizonyítékaként szolgálnak, hogy valaki jól teljesít ebben a feladatban. – Jeder Benchmark ist eine kompakte Theorie des Problems: Diese Fälle, die in diesem Format präsentiert und auf diese Weise bewertet werden, gelten als Beweis dafür, dass man diese Aufgabe gut bewältigt.

45. Ez az elmélet akkor válik jelentőssé, amikor egy kutatói közösség elkezd köré szervezni a munkáját. – Diese Theorie gewinnt an Bedeutung, wenn eine Forschungsgemeinschaft beginnt, ihre Arbeit daran auszurichten.

46. Az MNIST néven ismert, kézzel írt számjegyekből álló gyűjtemény szokatlanul tiszta formában mutatja be az előnyöket és a szűkítést. – Die als MNIST bekannte Sammlung handgeschriebener Ziffern veranschaulicht den Nutzen und die Eingrenzung in ungewöhnlich klarer Form.

47. Készítői két korábbi, a Nemzeti Szabványügyi és Technológiai Intézet (NIST) által karbantartott adatbázisból származó mintákat kombináltak. – Ihre Ersteller kombinierten Beispiele aus zwei früheren Datenbanken, die vom National Institute of Standards and Technology gepflegt wurden.

48. Az egyik forrás a Népszámlálási Hivatal alkalmazottaitól, a másik pedig középiskolás diákoktól származott, és a két forrás nehézségi szintje annyira eltért egymástól, hogy azokat a képzési és tesztanyagokban újra keverték. – Die eine Quelle stammte von Mitarbeitern des Census Bureau, die andere von Schülern der Oberstufe, und die beiden Quellen unterschieden sich hinsichtlich des Schwierigkeitsgrades so stark, dass sie über Trainings- und Testmaterial hinweg neu zusammengestellt wurden.

49. A szokásos változat 60 000 edzésképet és 10 000 tesztképet tartalmazott. – Die reguläre Version enthielt 60.000 Trainingsbilder und 10.000 Testbilder.

50. Minden fekete-fehér számjegy méretét úgy normalizálták, hogy beleférjen egy 20×20 képpontos négyzetbe, és pixel-tömegének megfelelően középre igazították egy 28×28 képpontos mezőben, a méretváltoztatási folyamat során pedig szürkeárnyalatok is megjelentek. – Jede schwarz-weiße Ziffer wurde größenmäßig so normalisiert, dass sie in ein Feld von 20 × 20 Pixeln passte, und anhand ihrer Pixeldichte in einem Feld von 28 × 28 Pixeln zentriert, wobei durch den Größenanpassungsprozess Graustufen entstanden.

51. Ezek a döntések a változatos kézírást kompakt, olcsó és pontosan értékelhető osztályozási problémává alakították. – Diese Entscheidungen verwandelten die variable Handschrift in ein kompaktes, kostengünstiges und präzise bewertbares Klassifizierungsproblem.

52. Több ezer hallgató és kutató tudott ugyanazon példákon edzeni egy módszert, és közvetlenül összehasonlítani a hibaarányokat. – Tausende von Studierenden und Forschern konnten eine Methode anhand derselben Beispiele trainieren und die Fehlerquoten direkt vergleichen.

53. A benchmark részben azért vált szabványos tesztpályává, mert technikailag elég egyszerű volt ahhoz, hogy hatalmas laboratórium nélkül is futtatható legyen. – Der Benchmark wurde zu einem Standard-Testfeld, unter anderem weil er technisch so überschaubar war, dass er ohne ein riesiges Labor durchgeführt werden konnte.

54. Ez a hozzáférhetőség tudományos erény volt, nem pedig kínos kompromisszum. – Diese Zugänglichkeit war ein wissenschaftlicher Vorzug, kein peinlicher Kompromiss.

55. Ugyanakkor a feladat abból indult ki, hogy minden bemeneti adatot már elválasztottak a környező jelektől, központosítottak, átméreteztek, és garantáltan a tíz kategória egyikébe tartozik. – Gleichzeitig ging die Aufgabe davon aus, dass jede Eingabe bereits von umgebenden Markierungen getrennt, zentriert und in der Größe angepasst worden war und garantiert zu einer von zehn Kategorien gehörte.

56. Egy banki csekk, egy sérült borítékon szereplő cím vagy egy sor sietve írt jegyzet általában nem ilyen állapotban érkezik. – Ein Bankscheck, eine Adresse auf einem beschädigten Umschlag oder eine Zeile hastiger Notizen liegen in der Regel nicht in diesem Zustand vor.

57. Egy működő felismerő rendszerben a karakterek felkutatása és elválasztása ugyanolyan fontos lehet, mint a címkék hozzárendelése az elkülönített képekhez. – In einem funktionierenden Erkennungssystem kann das Auffinden und Trennen von Zeichen genauso wichtig sein wie das Zuweisen von Bezeichnungen zu den isolierten Bildern.

58. Az MNIST nem állította tévesen, hogy a teljes problémát lefedné, és a róla szóló tanulmány több modulból álló, nagyobb dokumentumfelismerő rendszereket is tárgyalt. – MNIST hat nicht fälschlicherweise behauptet, das gesamte Problem abzudecken, und in der Veröffentlichung, die es dokumentierte, wurden größere Dokumentenerkennungssysteme mit mehreren Modulen erörtert.

59. A torzítás később merült fel, amikor a kényelmes komponensen elért sikert véletlenül a kézírás általános sikereként jelentették be. – Die Verzerrung entstand später, als Erfolge bei der einfach zu handhabenden Komponente beiläufig als Erfolge bei der Handschrifterkennung im Allgemeinen dargestellt wurden.

60. Az adatkészlet valami valósat mért, miközben a valódi feladat más részeit a kereten kívül hagyta. – Der Datensatz maß etwas Reales, während andere Teile der tatsächlichen Aufgabe außerhalb des Rahmens blieben.

61. Ez azt is szemlélteti, miért fontos az ökológiai érvényesség. – Er zeigt auch, warum ökologische Validität wichtig ist.

62. Egy teszt annyiban rendelkezik ökológiai érvényességgel, amennyiben a megteremtett feltételek mellett elért teljesítmény megbízható információt nyújt a rendszer tényleges használati környezetében várható teljesítményről. – Ein Test verfügt insofern über ökologische Validität, als die Leistung unter den dafür festgelegten Bedingungen verlässliche Aussagen über die Leistung in den Umgebungen zulässt, in denen das System tatsächlich eingesetzt wird.

63. Egyetlen benchmark sem rendelkezik ezzel a tulajdonsággal pusztán azért, mert címkéi pontosak. – Kein Benchmark besitzt diese Eigenschaft allein deshalb, weil seine Beschriftungen korrekt sind.

64. Az illeszkedés a kialakított feladat és azok a helyzetek közötti kapcsolattól függ, amelyekről az emberek következtetéseket vonnak le. – Die Eignung hängt von der Beziehung zwischen der konstruierten Aufgabe und den Situationen ab, aus denen Menschen Schlussfolgerungen ziehen.

65. Egy nagyobb és befolyásosabb példa az ImageNet-tel kezdődött. – Ein größeres und einflussreicheres Beispiel begann mit ImageNet.

66. A 2009-ben bevezetett adatbázis a WordNet főnévhierarchiáját használta gerincének, és kezdetben 3,2 millió képet tartalmazott, amelyek 5 247 kategóriára, vagyis szinonimakészletre voltak felosztva. – Die 2009 eingeführte Datenbank nutzte die Substantivhierarchie von WordNet als Gerüst und enthielt anfangs 3,2 Millionen Bilder, verteilt auf 5.247 Kategorien, sogenannte Synsets.

67. Az ImageNet Large Scale Visual Recognition Challenge ezután kijelölt egy részhalmazt a szabványosított összehasonlításhoz. – Die „ImageNet Large Scale Visual Recognition Challenge“ legte daraufhin eine Teilmenge für einen standardisierten Vergleich fest.

68. Legismertebb osztályozási feladata körülbelül 1,2 millió edzésképet biztosított, és arra kérte a rendszereket, hogy különböztessék meg egymástól az 1 000 tárgykategóriát. – Ihre bekannteste Klassifizierungsaufgabe stellte etwa 1,2 Millionen Trainingsbilder zur Verfügung und forderte die Systeme auf, zwischen 1.000 Objektkategorien zu unterscheiden.

69. Az éves verseny 2010-től 2017-ig tartott, és rendkívül jól láthatóvá tette a nagyméretű objektumfelismerés terén elért fejlődést. – Der jährlich stattfindende Wettbewerb lief von 2010 bis 2017 und machte Fortschritte bei der groß angelegten Objekterkennung ungewöhnlich deutlich.

70. 2012-ben például egy mély konvolúciós hálózat 15,3 százalékos hibaráta elérte az első öt helyet, ami messze alatta maradt a második legjobb pályamű 26,2 százalékos hibaráta alatt. – Im Jahr 2012 erreichte beispielsweise ein tiefes Faltungsnetzwerk eine Fehlerquote unter den fünf besten Ergebnissen von 15,3 Prozent und lag damit weit unter den 26,2 Prozent des zweitbesten Beitrags.

71. A közös teszt olyan módon tette láthatóvá az előrelépés mértékét, ahogyan az elszórt bemutatók nem tudták volna. – Der gemeinsame Test machte das Ausmaß dieses Fortschritts auf eine Weise sichtbar, wie es vereinzelte Demonstrationen nicht hätten leisten können.

72. Az ImageNet emellett igényes, közös munkaterhelést is biztosított, amely köré a szoftverek, a hardverhasználat és a kísérleti módszerek fejlesztése épülhetett. – ImageNet bot zudem eine anspruchsvolle gemeinsame Aufgabenstellung, an der Software, Hardware-Einsatz und experimentelles Know-how verbessert werden konnten.

73. Sikerének köszönhetően a ranglistán túlmutató lehetőségek is megnyíltak, beleértve az újrafelhasználható vizuális ábrázolásokat és más feladatokhoz is adaptálható technikákat. – Sein Erfolg eröffnete Möglichkeiten, die weit über die Rangliste hinausgingen, darunter wiederverwendbare visuelle Darstellungen und Techniken, die an andere Aufgaben angepasst werden konnten.

74. A hasznos referenciaérték egyben szelektív látásmód is volt. – Der nützliche Benchmark war zugleich ein selektives Prisma.

75. Az ImageNet kategóriái a WordNet szerkezetét és szókincsét örökölték, míg a verseny szervezői további döntéseket hoztak arról, hogy mely kategóriák és képek alkalmasak egy működőképes verseny lebonyolítására. – Die Kategorien von ImageNet übernahmen die Struktur und das Vokabular von WordNet, während die Organisatoren des Wettbewerbs zusätzliche Entscheidungen darüber trafen, welche Kategorien und Bilder einen praktikablen Wettbewerb ermöglichen würden.

76. Az ismert, 1000 osztályból álló osztályozási készlet körülbelül 120 különálló kutyafajta-címkét tartalmazott. – Der bekannte Klassifizierungssatz mit 1.000 Klassen umfasste etwa 120 verschiedene Bezeichnungen für Hunderassen.

77. Az egyes fajták megkülönböztetése a finom részletességű vizuális osztályozás jogos tesztje, de nem a gépi látás időtálló definíciója. – Die Unterscheidung einer Rasse von einer anderen ist ein legitimer Test für eine feinkörnige visuelle Klassifizierung, aber keine zeitlose Definition des maschinellen Sehens.

78. Szokatlanul nagy súlya volt ennek, mert ezek a megkülönböztetések éppen számosak voltak abban a rögzített kategóriakészletben, amelyet egy befolyásos verseny használt. – Dies hatte ungewöhnlich großes Gewicht, da diese Unterscheidungen zufällig in dem festen Kategoriensatz, der von einem einflussreichen Wettbewerb verwendet wurde, zahlreich vorkamen.

79. Egy rendszer rangot veszíthetett, ha két hasonló fajtát kevert össze, miközben nem kapott büntetést azért, ha egy vizuálisan fontos, de a listán nem szereplő kategóriában hibázott. – Ein System konnte an Rang verlieren, wenn es zwei ähnliche Rassen verwechselte, während es keine Abstrafung erhielt, wenn es in einer visuell wichtigen Kategorie versagte, die nicht in der Liste enthalten war.

80. Ez nem olyan hiba, amelyet egyszerűen egy tökéletes lista kiválasztásával lehetett volna kiküszöbölni, mert egyetlen véges lista sem képviseli a látás minden lehetséges felhasználását. – Das ist kein Mangel, der durch die einfache Auswahl einer perfekten Liste hätte beseitigt werden können, da keine endliche Liste jede plausible Anwendung der Bildverarbeitung abdeckt.

81. Ez annak a elkerülhetetlen következménye, hogy egy széles körű képességet véges feladatként fogalmazunk meg. – Dies ist die unvermeidliche Folge der Operationalisierung einer weit gefassten Fähigkeit als endliche Aufgabe.

82. A nehézség akkor kezdődik, amikor az eredményről szóló állításokból eltűnik a teszteléshez szükséges határ. – Die Schwierigkeit beginnt, wenn die für einen Test erforderliche Abgrenzung aus den Aussagen über das Ergebnis verschwindet.

83. A képbesorolás nem azonos a tárgyfelismeréssel, a helymeghatározás nem egyenlő a jelenet megértésével, és a gondosan összeválogatott fényképeken elért teljesítmény nem jelenti automatikusan azt, hogy minden fényképezőgéppel, minden éghajlati viszony mellett vagy minden munkakörnyezetben ugyanolyan jól fog teljesíteni. – Bildklassifizierung ist keine Objekterkennung, Lokalisierung ist kein Szenenverständnis, und die Leistung bei kuratierten Fotos ist nicht automatisch gleichbedeutend mit der Leistung bei jeder Kamera, jedem Klima oder jedem Einsatzort.

84. A verseny szervezői maguk is megkülönböztették ezeket a feladatokat, és a kutatási kérdések változásával módosították az adatkészleteket. – Die Organisatoren des Wettbewerbs haben diese Aufgaben selbst unterschieden und die Datensätze angepasst, als sich die Forschungsfragen änderten.

85. A gondos teljesítményértékelés ezért egyaránt igényel stabil magot és őszinte beszámolót arról, mi fekszik azon túl. – Ein sorgfältiges Benchmarking erfordert daher sowohl einen stabilen Kern als auch eine ehrliche Darstellung dessen, was darüber hinausgeht.

86. A stabilitás lehetővé teszi az eredmények időbeli felhalmozódását. – Stabilität ermöglicht es, dass sich Ergebnisse im Laufe der Zeit ansammeln.

87. A felülvizsgálat megakadályozza, hogy a tegnapi kezelhető helyettesítő változó a holnap megkérdőjelezhetetlen definíciójává váljon. – Überarbeitungen verhindern, dass der gestern noch handhabbare Näherungswert zur unhinterfragten Definition von morgen wird.

88. Ezen erények közötti feszültségben jelenik meg a történelmi függőség. – In der Spannung zwischen diesen Vorzügen kommt die historische Pfadabhängigkeit ins Spiel.

89. Egy adatkészlet közzététele csupán egy múltbeli esemény, és ez önmagában nem teszi egy tudományterületet pályafüggővé. – Die Veröffentlichung eines Datensatzes ist lediglich ein Ereignis in der Vergangenheit, und das allein macht ein Forschungsgebiet noch nicht pfadabhängig.

90. A pályafüggőség akkor kezdődik, amikor az adatkészlet átvétele megváltoztatja a későbbi kutatási döntések költségét, láthatóságát vagy valószínűségét. – Pfadabhängigkeit beginnt, wenn die Übernahme des Datensatzes die Kosten, die Sichtbarkeit oder die Wahrscheinlichkeit späterer Forschungsentscheidungen verändert.

91. Amint számos cikk ugyanazt az eredményt közli, egy új cikk relevanciáját azzal bizonyíthatja, hogy egy sorral kiegészíti az ismerős táblázatot. – Sobald viele Artikel denselben Wert angeben, kann ein neuer Artikel seine Relevanz dadurch begründen, dass er einer bekannten Tabelle eine Zeile hinzufügt.

92. Egy olyan kapacitásról szóló cikk, amelyre még nincs referenciaérték, először meg kell védenie a kapacitást, össze kell állítania az adatokat, igazolnia kell a mérőszámot, és meg kell győznie a lektorokat arról, hogy az eredmény bármivel összehasonlítható. – Eine Arbeit über eine noch nicht benchmarkte Kapazität muss zunächst diese Kapazität begründen, die Daten zusammenstellen, die Metrik rechtfertigen und die Gutachter davon überzeugen, dass das Ergebnis mit irgendetwas vergleichbar ist.

93. A régi út olcsóbb, mert a korábbi utazók már kifizették az útépítés költségeit. – Der alte Weg ist kostengünstiger, weil frühere Reisende für seine Anlage bezahlt haben.

94. Nyilvános kódok, adatbetöltők, hibaanalízisek, finomított alapértékek, előre betanított modellek és oktatási anyagok halmozódnak fel a bevett teszt körül. – Öffentlicher Code, Datenlader, Fehleranalysen, optimierte Baseline-Modelle, vortrainierte Modelle und Lehrmaterialien sammeln sich um den etablierten Test herum an.

95. A laboratóriumok olyan berendezéseket és szakértelmet szereznek be, amelyek alkalmasak a munkaterheléseik reprodukálására. – Forschungslabore beschaffen sich Ausrüstung und Fachwissen, die für die Reproduktion ihrer Arbeitslasten geeignet sind.

96. A hallgatók olyan kérdéseket választanak, amelyek egy diplomamunka időtartama alatt elismert eredményt hozhatnak. – Studierende wählen Fragestellungen aus, die innerhalb der Dauer eines Studiums zu einem anerkannten Ergebnis führen können.

97. A bírálók megtanulják, mi számít jelentős fejlődésnek, és ez az ismertség csökkenti a magyarázati terhet az azonos formátumot követő munkák esetében. – Gutachter lernen, was als sinnvolle Verbesserung gilt, und diese Vertrautheit verringert den Erklärungsaufwand für Arbeiten, die demselben Format folgen.

98. A finanszírozó szervezetek és a munkaadók elolvashatják az értéket anélkül, hogy minden kísérleti részletet ismernének, így a laboratóriumon kívül is értéket képvisel a benchmarkolt teljesítmény. – Förderinstitutionen und Arbeitgeber können die Zahlen interpretieren, ohne jedes experimentelle Detail zu beherrschen, wodurch die im Benchmark ermittelte Leistung auch außerhalb des Labors an Wert gewinnt.

99. Minden további felhasználó informatívabbá teszi a közös összehasonlítást, így egy referenciaérték hálózati hatást mutathat. – Jeder zusätzliche Nutzer macht den gemeinsamen Vergleich aussagekräftiger, sodass ein Benchmark einen Netzwerkeffekt entfalten kann.

100. A fokozott használat több alapértéket és eszközt eredményez; ezek a kiegészítők csökkentik a további használat költségeit, az alacsonyabb költségek pedig még több felhasználót vonzanak. – Eine stärkere Nutzung führt zu mehr Referenzwerten und Werkzeugen; diese Ergänzungen senken die Kosten für die weitere Nutzung, und niedrigere Kosten ziehen noch mehr Nutzung an.

101. Ez a pozitív visszacsatolás az a tényleges mechanizmus, amelynek révén egy korai mérési döntés átirányíthatja egy tudományterület későbbi lehetőségeinek terét. – Diese positive Rückkopplung ist der eigentliche Mechanismus, durch den eine frühe Messentscheidung den späteren Möglichkeitenraum eines Fachgebiets neu ausrichten kann.

102. Az alternatívák nem válnak fizikailag lehetetlenné. – Alternativen werden nicht physikalisch unmöglich.

103. Kevésbé láthatóvá válnak, nehezebben összehasonlíthatóvá válnak, és megvalósításuk drágábbá válik. – Sie werden weniger sichtbar, weniger vergleichbar und ihre Umsetzung wird teurer.

104. Egy bevett referenciaérték felváltása új adatgyűjtést, új annotációt, új értékelő szoftvert, régebbi rendszerek újbóli futtatását, valamint olyan csoportok közötti koordinációt igényelhet, amelyek nem mindegyike részesül egyformán a változásból. – Das Ersetzen eines fest etablierten Benchmarks kann neue Datenerhebungen, neue Annotationen, neue Auswertungssoftware, die erneute Ausführung älterer Systeme sowie die Koordination zwischen Gruppen erfordern, die nicht alle gleichermaßen von der Änderung profitieren.

105. Ezek olyan átállási költségek, amelyeket a bevezetés története okoz, nem pedig az eredeti feladat belső felsőbbrendűsége. – Dies sind Umstellungskosten, die eher durch die Geschichte der Einführung als durch die intrinsische Überlegenheit der ursprünglichen Aufgabe entstehen.

106. Ugyanakkor éppen ezek a kiegészítő beruházások teremtik meg a referenciaérték hatalmas értékét is. – Doch genau diese ergänzenden Investitionen schaffen auch den enormen Wert des Benchmarks.

107. Egy stabil szabvány megőrzi a közös tudásbázist, védi a korábbi kísérleti munkákat, és lehetővé teszi egy kis laboratórium számára, hogy összehasonlítsa magát sokkal nagyobbakkal. – Ein stabiler Standard bewahrt das gemeinsame Gedächtnis, schützt frühere experimentelle Arbeiten und ermöglicht es einem kleinen Labor, sich mit viel größeren zu vergleichen.

108. Ez egy hasznos, ugyanakkor korlátozó „bezártság” is. – Dies ist sowohl eine nützliche als auch eine einschränkende Bindung.

109. Az, hogy ezt „bezártságnak” nevezzük, nem jelenti azt, hogy a változás lehetetlen lenne, vagy hogy az eredeti választás ostoba volt. – Dies als „Lock-in“ zu bezeichnen, bedeutet nicht, dass Veränderungen unmöglich sind oder dass die ursprüngliche Entscheidung unklug war.

110. Azt jelenti, hogy a mai, megfizethető kutatási kérdések választéka részben a tegnapi koordinációtól függ. – Es bedeutet, dass die heutige Auswahl an realisierbaren Forschungsfragen teilweise von der gestrigen Koordination abhängt.

111. És nem minden referenciaérték indít el ilyen folyamatot. – Auch löst nicht jeder Benchmark einen solchen Prozess aus.

112. A számítógépes látás és a nyelvi referenciaértékekről készült átfogó felmérések azt mutatják, hogy sok közülük soha nem éri el a széles körű használatot, míg sok más gyorsan eléri a telítettségi pontot. – Umfangreiche Übersichtsstudien zu Benchmarks in den Bereichen Computer Vision und Sprachverarbeitung zeigen, dass viele nie eine breite Anwendung finden, während viele andere schnell die Sättigungsgrenze erreichen.

113. Egy adatkészletet közzé lehet tenni, röviden hivatkozni rá, majd elfelejteni anélkül, hogy átszervezné a területet. – Ein Datensatz kann veröffentlicht, kurz zitiert und wieder vergessen werden, ohne dass er ein Fachgebiet neu ordnet.

114. Csak akkor válik útvonalává, ha az ismételt használat erősítő technikai, társadalmi és intézményi beruházásokat épít ki körülötte. – Er wird erst dann zu einem Weg, wenn seine wiederholte Nutzung verstärkende technische, soziale und institutionelle Investitionen um ihn herum aufbaut.

115. Ez a ellenpélda azért fontos, mert elválasztja a történelmi eredetet a valódi útfüggőségtől. – Dieses Gegenbeispiel ist wichtig, weil es den historischen Ursprung von echter Pfadabhängigkeit trennt.

116. A Netflix-díj a referenciaértékek sikerének egy másik határát tárja fel. – Der Netflix-Preis offenbart eine andere Grenze des Erfolgs von Benchmarks.

117. 2006-ban a Netflix egymillió dollárt ajánlott fel annak, aki tíz százalékkal javítja a vállalat meglévő rendszerét a felhasználók filmértékeléseinek előrejelzésében. – Im Jahr 2006 lobte Netflix eine Million Dollar für eine zehnprozentige Verbesserung gegenüber seinem bestehenden System bei der Vorhersage von Nutzer-Filmbewertungen aus.

118. A verseny ezt a célt a négyzetes középértékű hiba (RMSE) segítségével operacionalizálta, amely statisztikai mutató a becsült csillagbesorolás és a felhasználó által ténylegesen megadott értékelés közötti eltérést büntette. – Der Wettbewerb operationalisierte dieses Ziel anhand des mittleren quadratischen Fehlers, einer statistischen Größe, die die Abweichung zwischen einer vorhergesagten Sternebewertung und der tatsächlich von einem Nutzer abgegebenen Bewertung abstrafte.

119. Ez a helyettesítő mutató pontos volt, automatikusan értékelhető, és alkalmas volt egy olyan versenyre, amelyben a vállalaton kívüli kutatók is részt vettek. – Dieser Indikator war präzise, ließ sich automatisch auswerten und eignete sich für einen Wettbewerb, an dem Forscher weit außerhalb des Unternehmens teilnahmen.

120. Közel három év alatt a résztvevők fontos ajánló-rendszeri módszereket fejlesztettek ki, és számos modellt kombináltak, hogy a javulás utolsó töredékeit is kihasználják. – Über einen Zeitraum von fast drei Jahren entwickelten die Teilnehmer wichtige Methoden für Empfehlungssysteme und kombinierten zahlreiche Modelle, um auch die letzten Bruchteile einer Verbesserung zu erzielen.

121. A győztes csapat átlépte a meghatározott küszöbértéket, és 2009-ben átvette a díjat. – Das Gewinnerteam überschritt die festgelegte Schwelle und erhielt 2009 den Preis.

122. A Netflix később arról számolt be, hogy a végső modellkombináció több száz prediktív modellt ötvözött. – Netflix berichtete später, dass das endgültige Ensemble Hunderte von Vorhersagemodellen miteinander kombinierte.

123. A mérnökök az új módszerek egy részét offline környezetben értékelték, de arra a következtetésre jutottak, hogy a további pontosságnövekedés nem indokolja azt a ráfordítást, amely a termelésbe való bevezetésükhöz szükséges lenne. – Die Ingenieure bewerteten einige der neuen Methoden offline, kamen jedoch zu dem Schluss, dass die zusätzliche Genauigkeit den Aufwand, der für die Einführung in die Produktion erforderlich gewesen wäre, nicht rechtfertigte.

124. Addigra a vállalat személyre szabási munkája is túllépett a csillagbesorolások előrejelzésén, és kiterjedt a tagok által ténylegesen megtekintésre választott tartalmak rangsorolására és elrendezésére is. – Zu diesem Zeitpunkt hatte sich die Personalisierungsarbeit des Unternehmens zudem über die Vorhersage von Sternebewertungen hinaus auf die Rangfolge und Anordnung der Inhalte ausgeweitet, die sich die Mitglieder tatsächlich ansehen könnten.

125. Az a leegyszerűsítő állítás, miszerint a Netflix egyáltalán nem használta fel a verseny keretében elvégzett munkát, téves, mivel egy korábbi, a haladásért járó díjra pályázó modellkészletből két erős komponenst átvettek és bevezettek. – Die pauschale Behauptung, Netflix habe keine der im Rahmen des Wettbewerbs entwickelten Arbeiten genutzt, ist falsch, da zwei leistungsstarke Teilansätze aus einem früheren „Progress-Prize“-Modell angepasst und eingesetzt wurden.

126. A verseny mutatóján elért utolsó javulás volt az, ami nem felelt meg a szélesebb körű termelési tesztnek. – Die letzte Verbesserung der Wettbewerbsmetrik war es, die den umfassenderen Produktionstest nicht bestand.

127. Az üzemeltetési költség, a frissítési sebesség, a mérnöki komplexitás, az interfésztervezés és a tényleges nézési döntések következményei mind fontosak voltak a szolgáltatás számára, bár nem képezték részét a verseny pontszámának. – Betriebskosten, Aktualisierungsgeschwindigkeit, technische Komplexität, Schnittstellendesign und die Konsequenzen einer tatsächlichen Auswahl beim Anschauen waren für den Dienst allesamt von Bedeutung, obwohl sie nicht Teil der Wettbewerbswertung waren.

128. A verseny nem mérte rosszul ezeket a tényezőket. – Der Wettbewerb hat diese Aspekte nicht schlecht gemessen.

129. Úgy tervezték, hogy szűkebb körű dolgokat mérjen. – Er war darauf ausgelegt, etwas Engeres zu messen.

130. A résztvevők racionálisan viselkedtek, amikor a közzétett kritériumot optimalizálták, és a Netflix is racionálisan járt el, amikor később egy szélesebb körű költség- és célkészletet értékelte. – Die Teilnehmer handelten rational, als sie das veröffentlichte Kriterium optimierten, und Netflix handelte rational, als es später eine breitere Palette von Kosten und Zielen bewertete.

131. Ez az eset tehát nem azt mutatja, hogy a teljesítménymérők haszontalanok lennének, vagy hogy a számszerű fejlődés hamis lenne. – Die Episode zeigt daher nicht, dass Benchmarks nutzlos sind oder dass numerischer Fortschritt vorgetäuscht ist.

132. Azt mutatja, hogy egy helyettesítő mutatóban elért valódi javulás nem feltétlenül elegendő bizonyíték arra, hogy javult az a tágabb rendszer is, amelyet a helyettesítő mutató képviselni hivatott. – Sie zeigt, dass eine echte Verbesserung eines Indikators ein unzureichender Beweis für eine Verbesserung des übergeordneten Systems bleiben kann, für dessen Darstellung der Indikator ausgewählt wurde.

133. Azt is mutatja, hogy az út nem örökre rögzített, hanem változtatható, mivel a szervezet átirányíthatta a figyelmet, amikor a szolgáltatás és az azzal kapcsolatos kérdések megváltoztak. – Sie zeigt auch, dass ein Weg geändert und nicht für immer befolgt wird, da die Organisation ihre Aufmerksamkeit umlenken konnte, als sich der Dienst und seine Fragestellungen änderten.

134. Egy kiforrott referenciaérték más jellegzetes problémákat is felvet. – Ein ausgereifter Benchmark entwickelt andere charakteristische Probleme.

135. Az egyik a telítettség, azaz az a felső határ, amelynél szinte minden komoly rendszer szinte minden tesztelemre helyesen válaszol. – Eines davon ist die Sättigung, das Annähern an eine Obergrenze, bei der nahezu jedes seriöse System nahezu jede Testfrage korrekt beantwortet.

136. E felső határ közelében a pontszámok közötti apró különbségek nagymértékben függhetnek annotációs hibáktól, kétértelmű esetekről vagy véletlenszerű eltérésektől. – In der Nähe dieser Obergrenze können winzige Punktunterschiede stark von Annotationsfehlern, mehrdeutigen Fällen oder zufälligen Schwankungen abhängen.

137. Az általános probléma továbbra is nehéz maradhat, még akkor is, ha a rögzített teszt már nem képes jól megkülönböztetni a módszereket. – Das allgemeine Problem kann weiterhin bestehen bleiben, selbst wenn der festgelegte Test die Methoden nicht mehr gut voneinander unterscheidet.

138. A kutatók gyakran úgy reagálnak, hogy nehezebb benchmarkot készítenek. – Forscher reagieren darauf oft mit der Entwicklung eines schwierigeren Benchmarks.

139. Az utód valóban új irányt nyithat az adateloszlás megváltoztatásával, elhanyagolt képességek hozzáadásával vagy a viselkedés kevésbé ellenőrzött körülmények közötti tesztelésével. – Der Nachfolger kann eine wirklich neue Richtung einschlagen, indem er die Datenverteilung ändert, bisher vernachlässigte Fähigkeiten hinzufügt oder das Verhalten unter weniger kontrollierten Bedingungen testet.

140. Az előd feltételezéseit is örökölheti azáltal, hogy megtartja ugyanazokat a kategóriákat, a válaszformátumot és a fő mutatószámot, miközben csupán a nehézségi szintet növeli. – Er kann aber auch die Annahmen des Vorgängers übernehmen, indem er dieselben Kategorien, dasselbe Antwortformat und dieselbe Hauptmetrik beibehält und lediglich den Schwierigkeitsgrad erhöht.

141. Az azonos formátumú, nehezebb kérdések inkább a meglévő utat hosszabbítják meg, mintsem új célállomást tárnának fel. – Schwierigere Fragen im gleichen Format verlängern eher den bestehenden Weg, als dass sie ein neues Ziel aufzeigen.

142. Az öröklődés azért vonzó, mert a régi eszközök és referenciaértékek újrahasznosíthatók. – Die Übernahme ist attraktiv, da alte Werkzeuge und Referenzwerte wiederverwendet werden können.

143. Egy radikálisabb teszt feláldoz egy bizonyos fokú folytonosságot, és egy új összehasonlító közösség felépítését igényli. – Ein radikalerer Test opfert einen Teil der Kontinuität und erfordert den Aufbau einer neuen Vergleichsgemeinschaft.

144. A régi referenciaérték története tehát befolyásolja, hogy melyik csere a legolcsóbb, még akkor is, ha mindenki egyetért abban, hogy cserére van szükség. – Die Geschichte des alten Benchmarks beeinflusst somit, welcher Ersatz am kostengünstigsten ist, selbst wenn sich alle einig sind, dass ein Ersatz notwendig ist.

145. A második probléma a kutatói közösség szintjén jelentkező túlillesztés. – Ein zweites Problem ist das Überanpassen auf der Ebene einer Forschungsgemeinschaft.

146. Előfordulhat, hogy egy csapat soha nem edz közvetlenül a hivatalos tesztkészleten, mégis ugyanazon referenciaértékre vonatkozó, évek óta megfigyelt eredmények alapján hoz ismétlődő tervezési döntéseket. – Ein Team trainiert vielleicht nie direkt auf dem offiziellen Testdatensatz und trifft dennoch wiederholt bestimmte Designentscheidungen, nachdem es jahrelange Ergebnisse auf demselben Benchmark gesehen hat.

147. Számos csapat és tanulmány esetében az architektúrák, az előfeldolgozási lépések és a betanítási módszerek a teszt stabil sajátosságaihoz igazodnak. – Über viele Teams und Veröffentlichungen hinweg passen sich Architekturen, Vorverarbeitungsschritte und Trainingsrezepte an die stabilen Besonderheiten des Tests an.

148. A pontszámjavulások így sokkal inkább az adott benchmarkra korlátozódhatnak, mint amit szélesebb értelmezésük sugallna. – Verbesserungen der Punktzahlen können dann spezifischer für diesen Benchmark sein, als ihre allgemeine Interpretation vermuten lässt.

149. Ez eltér a hagyományos, egyetlen kísérleten belüli túlillesztéstől, amelyben a modell megtanulja a képzési mintáit, de gyengén teljesít az ugyanarra a feladatra kiválasztott új mintákon. – Dies unterscheidet sich von gewöhnlichem Überanpassen innerhalb eines einzelnen Experiments, bei dem ein Modell seine Trainingsbeispiele lernt, aber bei neuen Beispielen, die für dieselbe beabsichtigte Aufgabe entnommen wurden, schlecht abschneidet.

150. A közösségi szintű benchmark-túlillesztés azt jelenti, hogy teljes módszereket választanak ki ismétlődően egy nyilvános célhoz viszonyítva, amíg a szakterület meg nem tanulja a teszt szabályszerűségeit. – Das Überanpassen an Benchmarks auf Gemeinschaftsebene betrifft die wiederholte Auswahl ganzer Methoden anhand eines öffentlichen Ziels, bis das Fachgebiet die Regelmäßigkeiten des Tests erlernt hat.

151. Mindkét probléma gyengíti a jelentett pontszámból máshol elért teljesítményre vonatkozó következtetést, de különböző előzményekből fakadnak. – Beide Probleme schwächen die Rückschlüsse von einem gemeldeten Ergebnis auf die Leistung in anderen Kontexten, entstehen jedoch aus unterschiedlichen Hintergründen.

152. A harmadik probléma a szennyeződés. – Ein drittes Problem ist die Kontamination.

153. Amikor egy nyilvános tesztelem bekerül a modell edzési adatai közé, az értékelés már nem méri tisztán a láthatatlan anyagokon elért teljesítményt. – Wenn eine öffentliche Testaufgabe in die Trainingsdaten eines Modells gelangt, misst die Bewertung nicht mehr eindeutig die Leistung bei bisher unbekanntem Material.

154. A kockázatot különösen nehéz ellenőrizni olyan nyelvi modellek esetében, amelyeket nagyon nagy nyilvános szöveggyűjtemények alapján tanítottak be, mivel maga a referenciaérték, az azzal kapcsolatos viták vagy felismerhető változatok megjelenhetnek ezekben a gyűjteményekben. – Das Risiko lässt sich besonders schwer bei Sprachmodellen überprüfen, die auf sehr großen Sammlungen öffentlicher Texte trainiert wurden, da der Benchmark selbst, Diskussionen darüber oder erkennbare Varianten in diesen Sammlungen vorkommen können.

155. A kitettség nem garantálja a memorizálást, és a szennyeződés nem minden pontszámot ugyanolyan mértékben emel. – Die bloße Exposition garantiert kein Auswendiglernen, und die Kontamination erhöht nicht jedes Ergebnis um denselben Betrag.

156. Ez azonban megdönti azt az egyszerű feltételezést, hogy minden közzétett tesztpélda kizárt maradt. – Sie widerlegt jedoch die einfache Annahme, dass jedes veröffentlichte Testbeispiel aus dem Training ausgeschlossen blieb.

157. A védett tesztkészletek, a megújított kérdések, a származási nyilvántartások és a statisztikai felderítési módszerek csökkenthetik vagy feltárhatják a problémát. – Geschützte Testsätze, erneuerte Fragen, Herkunftsnachweise und statistische Erkennungsmethoden können das Problem mindern oder aufdecken.

158. Minden megoldásnak vannak költségei, mivel a titoktartás akadályozza az ellenőrzést, a megújítás gyengíti az időbeli összehasonlítást, a származási nyilvántartás pedig hiányos lehet. – Jede Abhilfemaßnahme ist mit Kosten verbunden, da Geheimhaltung die Überprüfung behindert, Erneuerung den Vergleich über die Zeit hinweg schwächt und Herkunftsnachweise unvollständig sein können.

159. A benchmark karbantartása ezért folyamatos munka, nem pedig egyszeri adatállomány-közzététel. – Die Pflege von Benchmarks ist daher eine fortlaufende Aufgabe und kein einmaliger Vorgang der Veröffentlichung von Datensätzen.

160. Még egy szennyeződéstől mentes és nem telített tesztnek is hiányozhat az ökológiai érvényessége. – Selbst einem nicht kontaminierten und nicht gesättigten Test kann es an ökologischer Validität mangeln.

161. Előfordulhat, hogy egy rendszer kiválóan teljesít egy megadott listából való válaszválasztás során, de nehézségekbe ütközik, amikor pontosító kérdéseket kell feltennie, megszakítás után vissza kell állnia, vagy fel kell ismernie, hogy a felkínált válaszok közül egyik sem megfelelő. – Ein System mag sich zwar bei der Auswahl einer Antwort aus einer vorgegebenen Liste auszeichnen, hat jedoch Schwierigkeiten, wenn es klärende Fragen stellen, Unterbrechungen überwinden oder erkennen muss, dass keine der angebotenen Antworten passt.

162. A középre igazított fényképeken tesztelt képfeldolgozó modell szembesülhet zavaró elemekkel, szokatlan nézőpontokkal, változó fényviszonyokkal, meghibásodott érzékelőkkel, vagy olyan kategóriákkal, amelyek soha nem szerepeltek az értékelési adatkészletben. – Ein Bildverarbeitungsmodell, das an zentrierten Fotos getestet wurde, kann mit Unordnung, ungewöhnlichen Blickwinkeln, wechselnden Lichtverhältnissen, beschädigten Sensoren oder Kategorien konfrontiert werden, die im Bewertungsdatensatz nie vertreten waren.

163. Az eloszláseltolódás alatti megbízhatóság, a bizalom kalibrálása, a válaszidő, az energiafogyasztás, a karbantartási terhelés és a biztonságos meghibásodásra való képesség mind fontos szerepet játszhatnak a bevezetés során. – Zuverlässigkeit bei Verteilungsverschiebungen, die Kalibrierung des Konfidenzniveaus, Reaktionszeit, Energieverbrauch, Wartungsaufwand und die Fähigkeit, sicher auszufallen, können bei der Bereitstellung allesamt von Bedeutung sein.

164. Ezen tulajdonságok közül néhány mérhető, de ha mindet egyetlen pontszámba összesítenénk, az inkább elrejtené a köztük lévő ellentmondásokat, mintsem megszüntetné azokat. – Einige dieser Eigenschaften sind messbar, doch würden sie alle in einer einzigen Bewertung zusammengefasst, würden Konflikte zwischen ihnen verschleiert statt beseitigt.

165. Az adatkészlet kiválasztja, mely helyzetek számítanak, a mérőszám súlyozza a különböző hibákat, a rangsor pedig eldönti, hogyan jelennek meg a többféle eredmények. – Ein Datensatz wählt aus, welche Situationen zählen, eine Metrik gewichtet verschiedene Fehler, und eine Rangfolge entscheidet darüber, wie mehrere Ergebnisse sichtbar gemacht werden.

166. Ha bármelyik választást megváltoztatjuk, két rendszer helyet cserélhet anélkül, hogy bármelyik is megváltozna. – Ändert man eine dieser Entscheidungen, können zwei Systeme die Plätze tauschen, ohne dass sich eines der Systeme überhaupt ändert.

167. Ez a fordított helyzet nem bizonyítja, hogy a mérés önkényes lenne. – Diese Umkehrung beweist nicht, dass die Messung willkürlich ist.

168. Azt bizonyítja, hogy a teljesítmény mindig meghatározott esetekhez és következményekhez viszonyított teljesítményt jelent. – Sie beweist, dass Leistung immer Leistung in Bezug auf bestimmte Fälle und Konsequenzen bedeutet.

169. Amit egy teljesítménymérő kihagy, az nem szűnik meg szó szerint kutatási tárgyként létezni. – Was ein Benchmark auslässt, hört nicht buchstäblich auf, als Forschungsgegenstand zu existieren.

170. Nehezebbé válik annak bemutatása, összehasonlítása, közzététele és jutalmazása, ami növelheti az elhanyagolás valószínűségét. – Es wird schwieriger, dies darzustellen, zu vergleichen, zu veröffentlichen und zu belohnen, was eine Vernachlässigung wahrscheinlicher machen kann.

171. Egy olyan nyelv, amelyhez kevés a címkézett adat vagy nincs megbízható értékelési készlet, nem képtelen a technikai fejlődésre, de ennek a fejlődésnek a bemutatása és összegzése többe kerül. – Eine Sprache mit wenigen beschrifteten Daten oder ohne vertrauenswürdigen Bewertungsdatensatz ist nicht unfähig zu technischem Fortschritt, aber das Aufzeigen und Zusammenfassen dieses Fortschritts ist mit höheren Kosten verbunden.

172. A logisztika és az értékek ezen a ponton találkoznak. – An diesem Punkt treffen Logistik und Werte aufeinander.

173. Az automatikusan értékelhető feladatokat részben azért részesítik előnyben, mert olcsók, megismételhetők és skálázhatók, míg a szakértő embereket igénylő értékelések lassabbak és az értékelők között eltérhetnek. – Automatisch bewertete Aufgaben werden unter anderem deshalb bevorzugt, weil sie kostengünstig, wiederholbar und skalierbar sind, während Beurteilungen, die menschliche Experten erfordern, langsamer sind und je nach Bewerter variieren können.

174. Ezek a gyakorlati különbségek valósak, de a kényelem választása egyúttal a figyelmet is elosztja a képességek, a felhasználók és a környezetek között. – Diese praktischen Unterschiede sind real, doch die Entscheidung für Bequemlichkeit verteilt die Aufmerksamkeit auch auf verschiedene Fähigkeiten, Nutzer und Umgebungen.

175. A szűkítés egy kompromisszum, mielőtt pályafüggővé válna. – Die Verengung ist ein Kompromiss, bevor sie zu einer Pfadabhängigkeit wird.

176. Csak akkor válik pályafüggővé, ha az ismételt befektetések miatt a későbbi kiszélesítés vagy irányváltás drágábbá válik, mint amilyen az elején lett volna. – Sie wird erst dann pfadabhängig, wenn wiederholte Investitionen eine spätere Erweiterung oder Neuausrichtung kostspieliger machen, als es zu Beginn der Fall gewesen wäre.

177. A közösségek megőrizhetik a mozgásteret azáltal, hogy több referenciaértéket tartanak fenn, frissítik a tesztanyagot, több mutatót jelentenek, ellenőrzik a hibákat, és összehasonlítják a teljesítményt a domináns eloszláson kívül is. – Gemeinschaften können sich Handlungsspielraum bewahren, indem sie mehrere Benchmarks pflegen, Testmaterial aktualisieren, mehr als eine Kennzahl ausweisen, Fehler überprüfen und Leistungen außerhalb der vorherrschenden Verteilung vergleichen.

178. Egyetlen ilyen gyakorlat sem ad teljes képet, és egy nagy irányítópult ugyanolyan ritualizálttá válhat, mint egy egyetlen ranglistaszám. – Keine dieser Vorgehensweisen liefert ein vollständiges Bild, und ein umfangreiches Dashboard kann ebenso ritualisiert werden wie eine einzelne Zahl in einer Rangliste.

179. A többféle mérőszám nem azért hasznos, mert kiküszöböli az ítélkezést, hanem azért, mert láthatóvá teszi az egymással összeegyeztethetetlen célokat. – Mehrere Messgrößen sind nicht deshalb nützlich, weil sie das Urteilsvermögen überflüssig machen, sondern weil sie unvereinbare Ziele sichtbar halten.

180. A régi referenciaértékek történelmi koordinátaként megmaradhatnak, míg az új értékelések olyan területeket tárnak fel, amelyeket a régi feladat nem tudott lefedni. – Alte Benchmarks können als historische Koordinaten bestehen bleiben, während neue Bewertungen Bereiche ausloten, die die alte Aufgabe nicht abbilden konnte.

181. Ez a felállás megőrzi az összehasonlíthatóságot anélkül, hogy egy örökölt tesztnek állandó hatalmat adna a terület irányvonalának meghatározására. – Diese Anordnung bewahrt die Vergleichbarkeit, ohne einem überlieferten Test dauerhafte Autorität über die Richtung des Fachgebiets einzuräumen.

182. Emellett megőrzi az evolúciós képességet is, mivel a kutatók több elismert utat is fenntartanak, amelyeken keresztül egy hozzájárulás jelentőséget nyerhet. – Sie bewahrt auch die Entwicklungsfähigkeit, da Forscher mehr als einen anerkannten Weg beibehalten, auf dem ein Beitrag von Bedeutung sein kann.

183. A legjelentősebb referenciaértékekkel kapcsolatos döntések ezért nem csupán a későbbi, a pontszám javítására vonatkozó döntések. – Die folgenreichsten Entscheidungen bezüglich Benchmarks sind daher nicht nur die späteren Entscheidungen darüber, wie eine Punktzahl verbessert werden kann.

184. Hanem azok a korábbi döntések, amelyek arról szólnak, hogy mit kell tesztelni, hogyan kell pontozni, és mikor éri meg a folytonosság költségeit a felhalmozott összehasonlíthatóság. – Es sind die früheren Entscheidungen darüber, was getestet werden soll, wie es bewertet werden soll und wann die kumulierte Vergleichbarkeit die Kosten der Kontinuität wert ist.

185. Ezeket a döntéseket néha kis csapatok hozzák meg egy közvetlen gyakorlati probléma megoldása érdekében, de előfordulhat, hogy hosszú konzultációk és ismételt felülvizsgálatok eredményeként is születnek. – Diese Entscheidungen werden manchmal von kleinen Teams getroffen, die ein unmittelbares praktisches Problem lösen, können aber auch aus langen Beratungen und wiederholten Überarbeitungen hervorgehen.

186. Mindkét esetben hatáskörük kevésbé függ a szerzők tekintélyétől, mint inkább a körülöttük kialakuló felhasználói hálózattól és kiegészítőktől. – In beiden Fällen hängt ihre Reichweite weniger von der Autorität ihrer Urheber ab als vielmehr von dem Netzwerk aus Nutzern und Ergänzungen, das sich um sie herum entwickelt.

187. A templom falába vésett nyíl szándékosan szerény állítást fogalmaz meg egy pont magasságáról egy referenciarendszeren belül. – Der in die Kirchenwand geritzte Pfeil macht eine bewusst bescheidene Aussage über die Höhe eines Punktes innerhalb eines Referenzsystems.

188. Lehetővé teszi a későbbi földmérők számára, hogy visszatérjenek ugyanarra a szintre anélkül, hogy úgy tennének, mintha a magasság lenne a táj egyetlen tulajdonsága. – Er ermöglicht es späteren Vermessern, auf dieselbe Höhe zurückzukehren, ohne so zu tun, als sei die Höhe die einzige Eigenschaft der Landschaft.

189. Egy kutatási referenciaérték ugyanilyen fegyelmezett folytonosságot kínálhat, ha határai láthatóak maradnak. – Ein Forschungsmaßstab kann dieselbe disziplinierte Kontinuität bieten, wenn seine Grenzen sichtbar bleiben.

190. Amint azonban karrierek, kódok, felszerelések és elvárások halmozódnak fel az értéke körül, a jelzés útjelzőként kezd működni. – Sobald sich jedoch Karrieren, Codes, Ausrüstung und Erwartungen um seinen Wert herum ansammeln, beginnt die Markierung als Wegweiser zu fungieren.

191. A legmélyebb bezártság nem magában a számban rejlik, hanem abban a munkahálózatban, amely miatt olcsóbb továbbra is egy örökölt kérdésre válaszolni, mint egy másikat feltenni. – Die tiefste Verkrustung liegt nicht in der Zahl selbst, sondern in dem Geflecht aus Arbeit, das es billiger macht, eine geerbte Frage weiter zu beantworten, als eine andere zu stellen.

(aufklappen)magyar

1. Egy angol templom vagy híd kőfalába vésve, gyakran alig magasabban, mint egy ember derékmagassága, egy kis faragott nyíl egy vízszintes horony felé mutat.

2. Sok járókelő graffitinek vagy egy kőműves véletlen jelölésének téveszti ezt a szimbólumot.

3. Ez egy referenciapont, egy olyan rögzített pont, amelynek magasságát a földmérők határozták meg és rögzítették.

4. A név arra a szögvasra utal, amelyet a horonyba illesztve kis „padot” lehetett kialakítani a szintezőrúd számára.

5. Az Ordnance Survey végül mintegy háromnegyedmillió ilyen ponttal sűrítette fel országos szintezőhálózatát, és egy 2020-as ügynökségi útmutató szerint körülbelül félmillió még mindig létezik és használható.

6. Nagy-Britannia szárazföldjén a rögzített magasságaikat e hálózaton keresztül az Ordnance Datum Newlyn-hez kötötték.

7. Ez a referenciapont a 1915 és 1921 között Cornwallban, Newlynben végzett folyamatos árapálymérésekből számított átlagos tengerszintet őrzi, annak ellenére, hogy a tengerszint ott azóta is folyamatosan változik.

8. Néhány távoli sziget más helyi referenciapontokat használ, ami arra emlékeztet, hogy még egy országos referenciarendszernek is vannak határai.

9. Nincs semmi szent Newlynben vagy abban a hat évben.

10. A választás gyakorlatias, indokolt és körülményektől függő volt, mivel más stabil referenciarendszerek is megfeleltek volna.

11. Miután azonban elfogadták, lehetővé tette, hogy egymástól távol és évtizedekkel egymástól elválasztva dolgozó emberek ugyanazokkal a kifejezésekkel írják le a magasságokat.

12. A földmérő referenciapontja egy hivatkozási pont volt, nem pedig cél.

13. Senki sem épített dombot azért, hogy meghaladja azt.

14. Értéke a stabilitásból, a közös használatból és a szándékosan korlátozott igényből fakadt.

15. A modern kutatási referenciaérték megtartja ezt a koordináló funkciót, de általában hozzáad valamit, ami a vágási jelölésnek soha nem volt: egy elvégzendő feladatot és egy javítandó pontszámot.

16. Ez a kiegészítés a passzív hivatkozási pontot lehetséges cselekvési útmutatóvá alakítja.

17. A gépi tanulásban egy referenciaérték általában legalább három olyan választási lehetőséget egyesít, amelyek könnyen összekeverhetők.

18. Az adatkészlet kiválasztja azokat az eseteket, amelyeken a rendszert tesztelni fogják.

19. A feladat és az értékelési protokoll meghatározza, hogy a rendszernek mit kell tennie, és milyen feltételek mellett.

20. A mérőszám az eredményül kapott teljesítményeket és hibákat egy vagy több számba sűríti.

21. Az eredménytábla ezután ezeknek a számoknak megfelelően rangsorolhatja a rendszereket, így a összehasonlítás rendkívül gyors és áttekinthető lesz.

22. Minden komponens valódi intellektuális munkát végez.

23. Közös adatkészlet nélkül két laboratórium különböző példákon végezhet tesztelést.

24. Közös protokoll nélkül eltérő mennyiségű információt vagy segítséget adhatnak a rendszereiknek.

25. Közös mérőszám nélkül vitába keveredhetnek abban, hogy egy bizonyos hibatípus fontosabb-e, mint egy másik.

26. Minden közzétett eredmény így önmagában megalapozottnak tekinthető, de összehasonlításra szinte használhatatlan.

27. A közös referenciaérték közös kísérleti nyelvet teremt.

28. Lehetővé teszi a kutatók számára, hogy reprodukálják a kudarcokat, új módszereket teszteljenek a bevett referenciaértékekhez viszonyítva, és eredményeket gyűjtsenek anélkül, hogy minden módszertani vitát újra fel kellene vetniük.

29. Felfedheti a túlzott állításokat, mivel egy rendszer, amely a feltalálója bemutatójában kiemelkedő teljesítményt nyújt, most ugyanazokkal az esetekkel kell szembenéznie, mint riválisai.

30. A mérés tehát nem a felfedezés ellensége.

31. Számos területen ez az infrastruktúra része, amely lehetővé teszi a kumulatív felfedezéseket.

32. Az információkeresés egy árulkodó korai példát kínál.

33. Az első Text REtrieval Conference 1992-ben huszonöt résztvevő csoportot hozott össze egy olyan program keretében, amelyet a Nemzeti Szabványügyi és Technológiai Intézet (NIST) és a Védelmi Fejlett Kutatási Projektek Ügynöksége (DARPA) közösen támogatott.

34. Ahelyett, hogy minden csoport saját dokumentumait és kérdéseit választhatta volna, a program közös gyűjteményeket, témákat, értékelési eljárásokat és relevancia-értékeléseket biztosított.

35. A kutatók olyan léptékben tudták összehasonlítani a megközelítéseket, amelyet az egyes laboratóriumok egyedül nehezen tudtak volna megvalósítani.

36. A cél nem csupán egy győztes kihirdetése volt, és a folytatódó TREC-program kifejezetten verseny előtti kutatásként kezeli a gyakorlatot, nem pedig reklámként.

37. Tartós eredményei közé tartoznak az adatkészletek, az értékelések, a benyújtott futtatások és a technikai beszámolók, amelyeket a későbbi kutatók újra megvizsgálhatnak.

38. Egy közös teszt így kiszélesítheti egy terület gyakorlati lehetőségeinek körét azáltal, hogy a korábban drága kísérleteket megfizethetővé és összehasonlíthatóvá teszi.

39. Ezenkívül produktívabbá teszi a nézeteltéréseket is, mivel a versengő csoportok végül ugyanazon operatív kérdésről vitáznak.

40. Az operatív kérdések azonban soha nem azonosak azokkal a tágabb képességekkel, amelyeket képviselni hivatottak.

41. A keresés minősége például attól függ, hogy mire van szükségük a felhasználóknak, milyen dokumentumok léteznek, hogyan ítélik meg a relevanciát, és milyen költségekkel jár egy elmulasztott vagy félrevezető eredmény.

42. Ahhoz, hogy egy kísérlet megismételhető legyen, az adatgyűjteménynek és a mérőszámnak ennek a világnak a nagy részét meg kell őriznie.

43. Az ebből adódó egyszerűsítés megvilágosító lehet anélkül, hogy semleges vagy teljes lenne.

44. Minden benchmark a probléma tömör elmélete: ezek az esetek, ebben a formátumban bemutatva és ilyen módon pontozva, annak bizonyítékaként szolgálnak, hogy valaki jól teljesít ebben a feladatban.

45. Ez az elmélet akkor válik jelentőssé, amikor egy kutatói közösség elkezd köré szervezni a munkáját.

46. Az MNIST néven ismert, kézzel írt számjegyekből álló gyűjtemény szokatlanul tiszta formában mutatja be az előnyöket és a szűkítést.

47. Készítői két korábbi, a Nemzeti Szabványügyi és Technológiai Intézet (NIST) által karbantartott adatbázisból származó mintákat kombináltak.

48. Az egyik forrás a Népszámlálási Hivatal alkalmazottaitól, a másik pedig középiskolás diákoktól származott, és a két forrás nehézségi szintje annyira eltért egymástól, hogy azokat a képzési és tesztanyagokban újra keverték.

49. A szokásos változat 60 000 edzésképet és 10 000 tesztképet tartalmazott.

50. Minden fekete-fehér számjegy méretét úgy normalizálták, hogy beleférjen egy 20×20 képpontos négyzetbe, és pixel-tömegének megfelelően középre igazították egy 28×28 képpontos mezőben, a méretváltoztatási folyamat során pedig szürkeárnyalatok is megjelentek.

51. Ezek a döntések a változatos kézírást kompakt, olcsó és pontosan értékelhető osztályozási problémává alakították.

52. Több ezer hallgató és kutató tudott ugyanazon példákon edzeni egy módszert, és közvetlenül összehasonlítani a hibaarányokat.

53. A benchmark részben azért vált szabványos tesztpályává, mert technikailag elég egyszerű volt ahhoz, hogy hatalmas laboratórium nélkül is futtatható legyen.

54. Ez a hozzáférhetőség tudományos erény volt, nem pedig kínos kompromisszum.

55. Ugyanakkor a feladat abból indult ki, hogy minden bemeneti adatot már elválasztottak a környező jelektől, központosítottak, átméreteztek, és garantáltan a tíz kategória egyikébe tartozik.

56. Egy banki csekk, egy sérült borítékon szereplő cím vagy egy sor sietve írt jegyzet általában nem ilyen állapotban érkezik.

57. Egy működő felismerő rendszerben a karakterek felkutatása és elválasztása ugyanolyan fontos lehet, mint a címkék hozzárendelése az elkülönített képekhez.

58. Az MNIST nem állította tévesen, hogy a teljes problémát lefedné, és a róla szóló tanulmány több modulból álló, nagyobb dokumentumfelismerő rendszereket is tárgyalt.

59. A torzítás később merült fel, amikor a kényelmes komponensen elért sikert véletlenül a kézírás általános sikereként jelentették be.

60. Az adatkészlet valami valósat mért, miközben a valódi feladat más részeit a kereten kívül hagyta.

61. Ez azt is szemlélteti, miért fontos az ökológiai érvényesség.

62. Egy teszt annyiban rendelkezik ökológiai érvényességgel, amennyiben a megteremtett feltételek mellett elért teljesítmény megbízható információt nyújt a rendszer tényleges használati környezetében várható teljesítményről.

63. Egyetlen benchmark sem rendelkezik ezzel a tulajdonsággal pusztán azért, mert címkéi pontosak.

64. Az illeszkedés a kialakított feladat és azok a helyzetek közötti kapcsolattól függ, amelyekről az emberek következtetéseket vonnak le.

65. Egy nagyobb és befolyásosabb példa az ImageNet-tel kezdődött.

66. A 2009-ben bevezetett adatbázis a WordNet főnévhierarchiáját használta gerincének, és kezdetben 3,2 millió képet tartalmazott, amelyek 5 247 kategóriára, vagyis szinonimakészletre voltak felosztva.

67. Az ImageNet Large Scale Visual Recognition Challenge ezután kijelölt egy részhalmazt a szabványosított összehasonlításhoz.

68. Legismertebb osztályozási feladata körülbelül 1,2 millió edzésképet biztosított, és arra kérte a rendszereket, hogy különböztessék meg egymástól az 1 000 tárgykategóriát.

69. Az éves verseny 2010-től 2017-ig tartott, és rendkívül jól láthatóvá tette a nagyméretű objektumfelismerés terén elért fejlődést.

70. 2012-ben például egy mély konvolúciós hálózat 15,3 százalékos hibaráta elérte az első öt helyet, ami messze alatta maradt a második legjobb pályamű 26,2 százalékos hibaráta alatt.

71. A közös teszt olyan módon tette láthatóvá az előrelépés mértékét, ahogyan az elszórt bemutatók nem tudták volna.

72. Az ImageNet emellett igényes, közös munkaterhelést is biztosított, amely köré a szoftverek, a hardverhasználat és a kísérleti módszerek fejlesztése épülhetett.

73. Sikerének köszönhetően a ranglistán túlmutató lehetőségek is megnyíltak, beleértve az újrafelhasználható vizuális ábrázolásokat és más feladatokhoz is adaptálható technikákat.

74. A hasznos referenciaérték egyben szelektív látásmód is volt.

75. Az ImageNet kategóriái a WordNet szerkezetét és szókincsét örökölték, míg a verseny szervezői további döntéseket hoztak arról, hogy mely kategóriák és képek alkalmasak egy működőképes verseny lebonyolítására.

76. Az ismert, 1000 osztályból álló osztályozási készlet körülbelül 120 különálló kutyafajta-címkét tartalmazott.

77. Az egyes fajták megkülönböztetése a finom részletességű vizuális osztályozás jogos tesztje, de nem a gépi látás időtálló definíciója.

78. Szokatlanul nagy súlya volt ennek, mert ezek a megkülönböztetések éppen számosak voltak abban a rögzített kategóriakészletben, amelyet egy befolyásos verseny használt.

79. Egy rendszer rangot veszíthetett, ha két hasonló fajtát kevert össze, miközben nem kapott büntetést azért, ha egy vizuálisan fontos, de a listán nem szereplő kategóriában hibázott.

80. Ez nem olyan hiba, amelyet egyszerűen egy tökéletes lista kiválasztásával lehetett volna kiküszöbölni, mert egyetlen véges lista sem képviseli a látás minden lehetséges felhasználását.

81. Ez annak a elkerülhetetlen következménye, hogy egy széles körű képességet véges feladatként fogalmazunk meg.

82. A nehézség akkor kezdődik, amikor az eredményről szóló állításokból eltűnik a teszteléshez szükséges határ.

83. A képbesorolás nem azonos a tárgyfelismeréssel, a helymeghatározás nem egyenlő a jelenet megértésével, és a gondosan összeválogatott fényképeken elért teljesítmény nem jelenti automatikusan azt, hogy minden fényképezőgéppel, minden éghajlati viszony mellett vagy minden munkakörnyezetben ugyanolyan jól fog teljesíteni.

84. A verseny szervezői maguk is megkülönböztették ezeket a feladatokat, és a kutatási kérdések változásával módosították az adatkészleteket.

85. A gondos teljesítményértékelés ezért egyaránt igényel stabil magot és őszinte beszámolót arról, mi fekszik azon túl.

86. A stabilitás lehetővé teszi az eredmények időbeli felhalmozódását.

87. A felülvizsgálat megakadályozza, hogy a tegnapi kezelhető helyettesítő változó a holnap megkérdőjelezhetetlen definíciójává váljon.

88. Ezen erények közötti feszültségben jelenik meg a történelmi függőség.

89. Egy adatkészlet közzététele csupán egy múltbeli esemény, és ez önmagában nem teszi egy tudományterületet pályafüggővé.

90. A pályafüggőség akkor kezdődik, amikor az adatkészlet átvétele megváltoztatja a későbbi kutatási döntések költségét, láthatóságát vagy valószínűségét.

91. Amint számos cikk ugyanazt az eredményt közli, egy új cikk relevanciáját azzal bizonyíthatja, hogy egy sorral kiegészíti az ismerős táblázatot.

92. Egy olyan kapacitásról szóló cikk, amelyre még nincs referenciaérték, először meg kell védenie a kapacitást, össze kell állítania az adatokat, igazolnia kell a mérőszámot, és meg kell győznie a lektorokat arról, hogy az eredmény bármivel összehasonlítható.

93. A régi út olcsóbb, mert a korábbi utazók már kifizették az útépítés költségeit.

94. Nyilvános kódok, adatbetöltők, hibaanalízisek, finomított alapértékek, előre betanított modellek és oktatási anyagok halmozódnak fel a bevett teszt körül.

95. A laboratóriumok olyan berendezéseket és szakértelmet szereznek be, amelyek alkalmasak a munkaterheléseik reprodukálására.

96. A hallgatók olyan kérdéseket választanak, amelyek egy diplomamunka időtartama alatt elismert eredményt hozhatnak.

97. A bírálók megtanulják, mi számít jelentős fejlődésnek, és ez az ismertség csökkenti a magyarázati terhet az azonos formátumot követő munkák esetében.

98. A finanszírozó szervezetek és a munkaadók elolvashatják az értéket anélkül, hogy minden kísérleti részletet ismernének, így a laboratóriumon kívül is értéket képvisel a benchmarkolt teljesítmény.

99. Minden további felhasználó informatívabbá teszi a közös összehasonlítást, így egy referenciaérték hálózati hatást mutathat.

100. A fokozott használat több alapértéket és eszközt eredményez; ezek a kiegészítők csökkentik a további használat költségeit, az alacsonyabb költségek pedig még több felhasználót vonzanak.

101. Ez a pozitív visszacsatolás az a tényleges mechanizmus, amelynek révén egy korai mérési döntés átirányíthatja egy tudományterület későbbi lehetőségeinek terét.

102. Az alternatívák nem válnak fizikailag lehetetlenné.

103. Kevésbé láthatóvá válnak, nehezebben összehasonlíthatóvá válnak, és megvalósításuk drágábbá válik.

104. Egy bevett referenciaérték felváltása új adatgyűjtést, új annotációt, új értékelő szoftvert, régebbi rendszerek újbóli futtatását, valamint olyan csoportok közötti koordinációt igényelhet, amelyek nem mindegyike részesül egyformán a változásból.

105. Ezek olyan átállási költségek, amelyeket a bevezetés története okoz, nem pedig az eredeti feladat belső felsőbbrendűsége.

106. Ugyanakkor éppen ezek a kiegészítő beruházások teremtik meg a referenciaérték hatalmas értékét is.

107. Egy stabil szabvány megőrzi a közös tudásbázist, védi a korábbi kísérleti munkákat, és lehetővé teszi egy kis laboratórium számára, hogy összehasonlítsa magát sokkal nagyobbakkal.

108. Ez egy hasznos, ugyanakkor korlátozó „bezártság” is.

109. Az, hogy ezt „bezártságnak” nevezzük, nem jelenti azt, hogy a változás lehetetlen lenne, vagy hogy az eredeti választás ostoba volt.

110. Azt jelenti, hogy a mai, megfizethető kutatási kérdések választéka részben a tegnapi koordinációtól függ.

111. És nem minden referenciaérték indít el ilyen folyamatot.

112. A számítógépes látás és a nyelvi referenciaértékekről készült átfogó felmérések azt mutatják, hogy sok közülük soha nem éri el a széles körű használatot, míg sok más gyorsan eléri a telítettségi pontot.

113. Egy adatkészletet közzé lehet tenni, röviden hivatkozni rá, majd elfelejteni anélkül, hogy átszervezné a területet.

114. Csak akkor válik útvonalává, ha az ismételt használat erősítő technikai, társadalmi és intézményi beruházásokat épít ki körülötte.

115. Ez a ellenpélda azért fontos, mert elválasztja a történelmi eredetet a valódi útfüggőségtől.

116. A Netflix-díj a referenciaértékek sikerének egy másik határát tárja fel.

117. 2006-ban a Netflix egymillió dollárt ajánlott fel annak, aki tíz százalékkal javítja a vállalat meglévő rendszerét a felhasználók filmértékeléseinek előrejelzésében.

118. A verseny ezt a célt a négyzetes középértékű hiba (RMSE) segítségével operacionalizálta, amely statisztikai mutató a becsült csillagbesorolás és a felhasználó által ténylegesen megadott értékelés közötti eltérést büntette.

119. Ez a helyettesítő mutató pontos volt, automatikusan értékelhető, és alkalmas volt egy olyan versenyre, amelyben a vállalaton kívüli kutatók is részt vettek.

120. Közel három év alatt a résztvevők fontos ajánló-rendszeri módszereket fejlesztettek ki, és számos modellt kombináltak, hogy a javulás utolsó töredékeit is kihasználják.

121. A győztes csapat átlépte a meghatározott küszöbértéket, és 2009-ben átvette a díjat.

122. A Netflix később arról számolt be, hogy a végső modellkombináció több száz prediktív modellt ötvözött.

123. A mérnökök az új módszerek egy részét offline környezetben értékelték, de arra a következtetésre jutottak, hogy a további pontosságnövekedés nem indokolja azt a ráfordítást, amely a termelésbe való bevezetésükhöz szükséges lenne.

124. Addigra a vállalat személyre szabási munkája is túllépett a csillagbesorolások előrejelzésén, és kiterjedt a tagok által ténylegesen megtekintésre választott tartalmak rangsorolására és elrendezésére is.

125. Az a leegyszerűsítő állítás, miszerint a Netflix egyáltalán nem használta fel a verseny keretében elvégzett munkát, téves, mivel egy korábbi, a haladásért járó díjra pályázó modellkészletből két erős komponenst átvettek és bevezettek.

126. A verseny mutatóján elért utolsó javulás volt az, ami nem felelt meg a szélesebb körű termelési tesztnek.

127. Az üzemeltetési költség, a frissítési sebesség, a mérnöki komplexitás, az interfésztervezés és a tényleges nézési döntések következményei mind fontosak voltak a szolgáltatás számára, bár nem képezték részét a verseny pontszámának.

128. A verseny nem mérte rosszul ezeket a tényezőket.

129. Úgy tervezték, hogy szűkebb körű dolgokat mérjen.

130. A résztvevők racionálisan viselkedtek, amikor a közzétett kritériumot optimalizálták, és a Netflix is racionálisan járt el, amikor később egy szélesebb körű költség- és célkészletet értékelte.

131. Ez az eset tehát nem azt mutatja, hogy a teljesítménymérők haszontalanok lennének, vagy hogy a számszerű fejlődés hamis lenne.

132. Azt mutatja, hogy egy helyettesítő mutatóban elért valódi javulás nem feltétlenül elegendő bizonyíték arra, hogy javult az a tágabb rendszer is, amelyet a helyettesítő mutató képviselni hivatott.

133. Azt is mutatja, hogy az út nem örökre rögzített, hanem változtatható, mivel a szervezet átirányíthatta a figyelmet, amikor a szolgáltatás és az azzal kapcsolatos kérdések megváltoztak.

134. Egy kiforrott referenciaérték más jellegzetes problémákat is felvet.

135. Az egyik a telítettség, azaz az a felső határ, amelynél szinte minden komoly rendszer szinte minden tesztelemre helyesen válaszol.

136. E felső határ közelében a pontszámok közötti apró különbségek nagymértékben függhetnek annotációs hibáktól, kétértelmű esetekről vagy véletlenszerű eltérésektől.

137. Az általános probléma továbbra is nehéz maradhat, még akkor is, ha a rögzített teszt már nem képes jól megkülönböztetni a módszereket.

138. A kutatók gyakran úgy reagálnak, hogy nehezebb benchmarkot készítenek.

139. Az utód valóban új irányt nyithat az adateloszlás megváltoztatásával, elhanyagolt képességek hozzáadásával vagy a viselkedés kevésbé ellenőrzött körülmények közötti tesztelésével.

140. Az előd feltételezéseit is örökölheti azáltal, hogy megtartja ugyanazokat a kategóriákat, a válaszformátumot és a fő mutatószámot, miközben csupán a nehézségi szintet növeli.

141. Az azonos formátumú, nehezebb kérdések inkább a meglévő utat hosszabbítják meg, mintsem új célállomást tárnának fel.

142. Az öröklődés azért vonzó, mert a régi eszközök és referenciaértékek újrahasznosíthatók.

143. Egy radikálisabb teszt feláldoz egy bizonyos fokú folytonosságot, és egy új összehasonlító közösség felépítését igényli.

144. A régi referenciaérték története tehát befolyásolja, hogy melyik csere a legolcsóbb, még akkor is, ha mindenki egyetért abban, hogy cserére van szükség.

145. A második probléma a kutatói közösség szintjén jelentkező túlillesztés.

146. Előfordulhat, hogy egy csapat soha nem edz közvetlenül a hivatalos tesztkészleten, mégis ugyanazon referenciaértékre vonatkozó, évek óta megfigyelt eredmények alapján hoz ismétlődő tervezési döntéseket.

147. Számos csapat és tanulmány esetében az architektúrák, az előfeldolgozási lépések és a betanítási módszerek a teszt stabil sajátosságaihoz igazodnak.

148. A pontszámjavulások így sokkal inkább az adott benchmarkra korlátozódhatnak, mint amit szélesebb értelmezésük sugallna.

149. Ez eltér a hagyományos, egyetlen kísérleten belüli túlillesztéstől, amelyben a modell megtanulja a képzési mintáit, de gyengén teljesít az ugyanarra a feladatra kiválasztott új mintákon.

150. A közösségi szintű benchmark-túlillesztés azt jelenti, hogy teljes módszereket választanak ki ismétlődően egy nyilvános célhoz viszonyítva, amíg a szakterület meg nem tanulja a teszt szabályszerűségeit.

151. Mindkét probléma gyengíti a jelentett pontszámból máshol elért teljesítményre vonatkozó következtetést, de különböző előzményekből fakadnak.

152. A harmadik probléma a szennyeződés.

153. Amikor egy nyilvános tesztelem bekerül a modell edzési adatai közé, az értékelés már nem méri tisztán a láthatatlan anyagokon elért teljesítményt.

154. A kockázatot különösen nehéz ellenőrizni olyan nyelvi modellek esetében, amelyeket nagyon nagy nyilvános szöveggyűjtemények alapján tanítottak be, mivel maga a referenciaérték, az azzal kapcsolatos viták vagy felismerhető változatok megjelenhetnek ezekben a gyűjteményekben.

155. A kitettség nem garantálja a memorizálást, és a szennyeződés nem minden pontszámot ugyanolyan mértékben emel.

156. Ez azonban megdönti azt az egyszerű feltételezést, hogy minden közzétett tesztpélda kizárt maradt.

157. A védett tesztkészletek, a megújított kérdések, a származási nyilvántartások és a statisztikai felderítési módszerek csökkenthetik vagy feltárhatják a problémát.

158. Minden megoldásnak vannak költségei, mivel a titoktartás akadályozza az ellenőrzést, a megújítás gyengíti az időbeli összehasonlítást, a származási nyilvántartás pedig hiányos lehet.

159. A benchmark karbantartása ezért folyamatos munka, nem pedig egyszeri adatállomány-közzététel.

160. Még egy szennyeződéstől mentes és nem telített tesztnek is hiányozhat az ökológiai érvényessége.

161. Előfordulhat, hogy egy rendszer kiválóan teljesít egy megadott listából való válaszválasztás során, de nehézségekbe ütközik, amikor pontosító kérdéseket kell feltennie, megszakítás után vissza kell állnia, vagy fel kell ismernie, hogy a felkínált válaszok közül egyik sem megfelelő.

162. A középre igazított fényképeken tesztelt képfeldolgozó modell szembesülhet zavaró elemekkel, szokatlan nézőpontokkal, változó fényviszonyokkal, meghibásodott érzékelőkkel, vagy olyan kategóriákkal, amelyek soha nem szerepeltek az értékelési adatkészletben.

163. Az eloszláseltolódás alatti megbízhatóság, a bizalom kalibrálása, a válaszidő, az energiafogyasztás, a karbantartási terhelés és a biztonságos meghibásodásra való képesség mind fontos szerepet játszhatnak a bevezetés során.

164. Ezen tulajdonságok közül néhány mérhető, de ha mindet egyetlen pontszámba összesítenénk, az inkább elrejtené a köztük lévő ellentmondásokat, mintsem megszüntetné azokat.

165. Az adatkészlet kiválasztja, mely helyzetek számítanak, a mérőszám súlyozza a különböző hibákat, a rangsor pedig eldönti, hogyan jelennek meg a többféle eredmények.

166. Ha bármelyik választást megváltoztatjuk, két rendszer helyet cserélhet anélkül, hogy bármelyik is megváltozna.

167. Ez a fordított helyzet nem bizonyítja, hogy a mérés önkényes lenne.

168. Azt bizonyítja, hogy a teljesítmény mindig meghatározott esetekhez és következményekhez viszonyított teljesítményt jelent.

169. Amit egy teljesítménymérő kihagy, az nem szűnik meg szó szerint kutatási tárgyként létezni.

170. Nehezebbé válik annak bemutatása, összehasonlítása, közzététele és jutalmazása, ami növelheti az elhanyagolás valószínűségét.

171. Egy olyan nyelv, amelyhez kevés a címkézett adat vagy nincs megbízható értékelési készlet, nem képtelen a technikai fejlődésre, de ennek a fejlődésnek a bemutatása és összegzése többe kerül.

172. A logisztika és az értékek ezen a ponton találkoznak.

173. Az automatikusan értékelhető feladatokat részben azért részesítik előnyben, mert olcsók, megismételhetők és skálázhatók, míg a szakértő embereket igénylő értékelések lassabbak és az értékelők között eltérhetnek.

174. Ezek a gyakorlati különbségek valósak, de a kényelem választása egyúttal a figyelmet is elosztja a képességek, a felhasználók és a környezetek között.

175. A szűkítés egy kompromisszum, mielőtt pályafüggővé válna.

176. Csak akkor válik pályafüggővé, ha az ismételt befektetések miatt a későbbi kiszélesítés vagy irányváltás drágábbá válik, mint amilyen az elején lett volna.

177. A közösségek megőrizhetik a mozgásteret azáltal, hogy több referenciaértéket tartanak fenn, frissítik a tesztanyagot, több mutatót jelentenek, ellenőrzik a hibákat, és összehasonlítják a teljesítményt a domináns eloszláson kívül is.

178. Egyetlen ilyen gyakorlat sem ad teljes képet, és egy nagy irányítópult ugyanolyan ritualizálttá válhat, mint egy egyetlen ranglistaszám.

179. A többféle mérőszám nem azért hasznos, mert kiküszöböli az ítélkezést, hanem azért, mert láthatóvá teszi az egymással összeegyeztethetetlen célokat.

180. A régi referenciaértékek történelmi koordinátaként megmaradhatnak, míg az új értékelések olyan területeket tárnak fel, amelyeket a régi feladat nem tudott lefedni.

181. Ez a felállás megőrzi az összehasonlíthatóságot anélkül, hogy egy örökölt tesztnek állandó hatalmat adna a terület irányvonalának meghatározására.

182. Emellett megőrzi az evolúciós képességet is, mivel a kutatók több elismert utat is fenntartanak, amelyeken keresztül egy hozzájárulás jelentőséget nyerhet.

183. A legjelentősebb referenciaértékekkel kapcsolatos döntések ezért nem csupán a későbbi, a pontszám javítására vonatkozó döntések.

184. Hanem azok a korábbi döntések, amelyek arról szólnak, hogy mit kell tesztelni, hogyan kell pontozni, és mikor éri meg a folytonosság költségeit a felhalmozott összehasonlíthatóság.

185. Ezeket a döntéseket néha kis csapatok hozzák meg egy közvetlen gyakorlati probléma megoldása érdekében, de előfordulhat, hogy hosszú konzultációk és ismételt felülvizsgálatok eredményeként is születnek.

186. Mindkét esetben hatáskörük kevésbé függ a szerzők tekintélyétől, mint inkább a körülöttük kialakuló felhasználói hálózattól és kiegészítőktől.

187. A templom falába vésett nyíl szándékosan szerény állítást fogalmaz meg egy pont magasságáról egy referenciarendszeren belül.

188. Lehetővé teszi a későbbi földmérők számára, hogy visszatérjenek ugyanarra a szintre anélkül, hogy úgy tennének, mintha a magasság lenne a táj egyetlen tulajdonsága.

189. Egy kutatási referenciaérték ugyanilyen fegyelmezett folytonosságot kínálhat, ha határai láthatóak maradnak.

190. Amint azonban karrierek, kódok, felszerelések és elvárások halmozódnak fel az értéke körül, a jelzés útjelzőként kezd működni.

191. A legmélyebb bezártság nem magában a számban rejlik, hanem abban a munkahálózatban, amely miatt olcsóbb továbbra is egy örökölt kérdésre válaszolni, mint egy másikat feltenni.

(aufklappen)német

1. In die Steinmauer einer englischen Kirche oder Brücke eingelassen, oft nicht höher als die Hüfthöhe eines Menschen, zeigt ein kleiner, eingemeißelter Pfeil auf eine horizontale Rille.

2. Viele Passanten halten das Symbol fälschlicherweise für Graffiti oder die zufällige Markierung eines Maurers.

3. Es handelt sich um einen Vermessungspunkt, einen festen Punkt, dessen Höhe Vermessungsingenieure ermittelt und dokumentiert haben.

4. Der Name erinnert an das Winkeleisen, das in die Rille eingesetzt werden konnte, um eine kleine Auflage für einen Nivellierstab zu bilden.

5. Die Ordnance Survey verdichtete schließlich ihr nationales Nivelliernetz mit rund einer Dreiviertelmillion solcher Markierungen, und ein Leitfaden der Behörde aus dem Jahr 2020 berichtete, dass etwa eine halbe Million davon noch vorhanden und nutzbar sind.

6. Auf dem britischen Festland wurden ihre aufgezeichneten Höhen über dieses Netzwerk an das Ordnance Datum Newlyn gebunden.

7. Dieser Bezugspunkt bewahrt den mittleren Meeresspiegel, der aus kontinuierlichen Gezeitenmessungen in Newlyn in Cornwall zwischen 1915 und 1921 berechnet wurde, auch wenn sich der Meeresspiegel dort seitdem weiter verändert hat.

8. Einige abgelegene Inseln verwenden andere lokale Bezugssysteme, was daran erinnert, dass selbst ein nationales Referenzsystem seine Grenzen hat.

9. An Newlyn oder diesen sechs Jahren ist nichts Heiliges.

10. Die Wahl war praktisch, vertretbar und bedingt, da auch andere stabile Referenzsysteme hätten dienen können.

11. Nach seiner Einführung ermöglichte es jedoch Menschen, die weit voneinander entfernt und Jahrzehnte auseinander lebten, Höhen mit denselben Begriffen zu beschreiben.

12. Ein Vermessungsreferenzpunkt war ein Bezugspunkt, kein Ziel.

13. Niemand hat einen Hügel aufgeschüttet, um ihn zu übertreffen.

14. Sein Wert ergab sich aus Stabilität, gemeinsamer Nutzung und einem bewusst begrenzten Anspruch.

15. Der moderne Forschungs-Benchmark behält diese koordinierende Funktion bei, fügt aber in der Regel etwas hinzu, was der Höhenpunkt nie hatte: eine zu erfüllende Aufgabe und eine zu verbessernde Punktzahl.

16. Diese Ergänzung verwandelt einen passiven Bezugspunkt in einen möglichen Leitfaden für das Handeln.

17. Ein Benchmark im maschinellen Lernen verbindet normalerweise mindestens drei Optionen, die leicht miteinander verschmelzen können.

18. Ein Datensatz wählt die Fälle aus, anhand derer ein System getestet wird.

19. Eine Aufgabe und ihr Bewertungsprotokoll legen fest, was das System unter welchen Bedingungen leisten muss.

20. Eine Metrik fasst die resultierenden Leistungen und Fehler in einer oder mehreren Zahlen zusammen.

21. Eine Rangliste kann die Systeme dann anhand dieser Zahlen ordnen, wodurch der Vergleich ungewöhnlich schnell und anschaulich wird.

22. Jede Komponente leistet echte intellektuelle Arbeit.

23. Ohne einen gemeinsamen Datensatz könnten zwei Labore Tests an unterschiedlichen Beispielen durchführen.

24. Ohne ein gemeinsames Protokoll könnten sie ihren Systemen unterschiedliche Mengen an Informationen oder Unterstützung zur Verfügung stellen.

25. Ohne eine gemeinsame Metrik könnten sie sich darüber uneinig sein, ob eine bestimmte Art von Fehler schwerwiegender ist als eine andere.

26. Jedes veröffentlichte Ergebnis wäre dann für sich genommen zwar vertretbar, für Vergleiche jedoch nahezu unbrauchbar.

27. Ein gemeinsamer Benchmark schafft eine gemeinsame experimentelle Sprache.

28. Er ermöglicht es Forschern, Fehlschläge zu reproduzieren, eine neue Methode anhand etablierter Referenzwerte zu testen und Ergebnisse zu sammeln, anstatt jede methodische Debatte neu zu eröffnen.

29. Er kann übertriebene Behauptungen entlarven, da ein System, das in der Demonstration seines Erfinders glänzt, sich nun denselben Fällen stellen muss wie seine Konkurrenten.

30. Messung ist daher kein Feind der Entdeckung.

31. In vielen Fachgebieten ist sie Teil der Infrastruktur, die kumulative Entdeckungen erst möglich macht.

32. Die Informationsgewinnung bietet ein aufschlussreiches frühes Beispiel.

33. Die erste Text REtrieval Conference im Jahr 1992 brachte 25 teilnehmende Gruppen im Rahmen eines Programms zusammen, das vom National Institute of Standards and Technology und der Defense Advanced Research Projects Agency gemeinsam gefördert wurde.

34. Anstatt jeder Gruppe zu gestatten, ihre eigenen Dokumente und Fragestellungen auszuwählen, stellte das Programm gemeinsame Sammlungen, Themen, Bewertungsverfahren und Relevanzbeurteilungen zur Verfügung.

35. Die Forscher konnten Ansätze in einem Umfang vergleichen, den einzelne Labore allein nur schwer hätten realisieren können.

36. Es ging nicht lediglich darum, einen Sieger zu küren, und das fortlaufende TREC-Programm behandelt die Übung ausdrücklich als vorwettbewerbliche Forschung und nicht als Werbung.

37. Zu seinen dauerhaften Ergebnissen gehören Datensätze, Bewertungen, eingereichte Durchläufe und technische Berichte, die spätere Forscher erneut einsehen können.

38. Ein gemeinsamer Test kann somit den Raum der praktischen Möglichkeiten eines Fachgebiets erweitern, indem er zuvor kostspielige Experimente erschwinglich und vergleichbar macht.

39. Er macht auch Meinungsverschiedenheiten produktiver, da konkurrierende Gruppen sich schließlich über dieselbe operative Frage uneinig sind.

40. Operative Fragen sind jedoch niemals identisch mit den umfassenden Fähigkeiten, die sie repräsentieren sollen.

41. Die Suchqualität hängt beispielsweise davon ab, was Nutzer benötigen, welche Dokumente vorhanden sind, wie Relevanz beurteilt wird und welche Kosten sich aus einem fehlenden oder irreführenden Ergebnis ergeben.

42. Eine Sammlung und eine Metrik müssen einen Großteil dieser Welt noch einbeziehen, um ein Experiment wiederholbar zu machen.

43. Die daraus resultierende Vereinfachung kann aufschlussreich sein, ohne neutral oder vollständig zu sein.

44. Jeder Benchmark ist eine kompakte Theorie des Problems: Diese Fälle, die in diesem Format präsentiert und auf diese Weise bewertet werden, gelten als Beweis dafür, dass man diese Aufgabe gut bewältigt.

45. Diese Theorie gewinnt an Bedeutung, wenn eine Forschungsgemeinschaft beginnt, ihre Arbeit daran auszurichten.

46. Die als MNIST bekannte Sammlung handgeschriebener Ziffern veranschaulicht den Nutzen und die Eingrenzung in ungewöhnlich klarer Form.

47. Ihre Ersteller kombinierten Beispiele aus zwei früheren Datenbanken, die vom National Institute of Standards and Technology gepflegt wurden.

48. Die eine Quelle stammte von Mitarbeitern des Census Bureau, die andere von Schülern der Oberstufe, und die beiden Quellen unterschieden sich hinsichtlich des Schwierigkeitsgrades so stark, dass sie über Trainings- und Testmaterial hinweg neu zusammengestellt wurden.

49. Die reguläre Version enthielt 60.000 Trainingsbilder und 10.000 Testbilder.

50. Jede schwarz-weiße Ziffer wurde größenmäßig so normalisiert, dass sie in ein Feld von 20 × 20 Pixeln passte, und anhand ihrer Pixeldichte in einem Feld von 28 × 28 Pixeln zentriert, wobei durch den Größenanpassungsprozess Graustufen entstanden.

51. Diese Entscheidungen verwandelten die variable Handschrift in ein kompaktes, kostengünstiges und präzise bewertbares Klassifizierungsproblem.

52. Tausende von Studierenden und Forschern konnten eine Methode anhand derselben Beispiele trainieren und die Fehlerquoten direkt vergleichen.

53. Der Benchmark wurde zu einem Standard-Testfeld, unter anderem weil er technisch so überschaubar war, dass er ohne ein riesiges Labor durchgeführt werden konnte.

54. Diese Zugänglichkeit war ein wissenschaftlicher Vorzug, kein peinlicher Kompromiss.

55. Gleichzeitig ging die Aufgabe davon aus, dass jede Eingabe bereits von umgebenden Markierungen getrennt, zentriert und in der Größe angepasst worden war und garantiert zu einer von zehn Kategorien gehörte.

56. Ein Bankscheck, eine Adresse auf einem beschädigten Umschlag oder eine Zeile hastiger Notizen liegen in der Regel nicht in diesem Zustand vor.

57. In einem funktionierenden Erkennungssystem kann das Auffinden und Trennen von Zeichen genauso wichtig sein wie das Zuweisen von Bezeichnungen zu den isolierten Bildern.

58. MNIST hat nicht fälschlicherweise behauptet, das gesamte Problem abzudecken, und in der Veröffentlichung, die es dokumentierte, wurden größere Dokumentenerkennungssysteme mit mehreren Modulen erörtert.

59. Die Verzerrung entstand später, als Erfolge bei der einfach zu handhabenden Komponente beiläufig als Erfolge bei der Handschrifterkennung im Allgemeinen dargestellt wurden.

60. Der Datensatz maß etwas Reales, während andere Teile der tatsächlichen Aufgabe außerhalb des Rahmens blieben.

61. Er zeigt auch, warum ökologische Validität wichtig ist.

62. Ein Test verfügt insofern über ökologische Validität, als die Leistung unter den dafür festgelegten Bedingungen verlässliche Aussagen über die Leistung in den Umgebungen zulässt, in denen das System tatsächlich eingesetzt wird.

63. Kein Benchmark besitzt diese Eigenschaft allein deshalb, weil seine Beschriftungen korrekt sind.

64. Die Eignung hängt von der Beziehung zwischen der konstruierten Aufgabe und den Situationen ab, aus denen Menschen Schlussfolgerungen ziehen.

65. Ein größeres und einflussreicheres Beispiel begann mit ImageNet.

66. Die 2009 eingeführte Datenbank nutzte die Substantivhierarchie von WordNet als Gerüst und enthielt anfangs 3,2 Millionen Bilder, verteilt auf 5.247 Kategorien, sogenannte Synsets.

67. Die „ImageNet Large Scale Visual Recognition Challenge“ legte daraufhin eine Teilmenge für einen standardisierten Vergleich fest.

68. Ihre bekannteste Klassifizierungsaufgabe stellte etwa 1,2 Millionen Trainingsbilder zur Verfügung und forderte die Systeme auf, zwischen 1.000 Objektkategorien zu unterscheiden.

69. Der jährlich stattfindende Wettbewerb lief von 2010 bis 2017 und machte Fortschritte bei der groß angelegten Objekterkennung ungewöhnlich deutlich.

70. Im Jahr 2012 erreichte beispielsweise ein tiefes Faltungsnetzwerk eine Fehlerquote unter den fünf besten Ergebnissen von 15,3 Prozent und lag damit weit unter den 26,2 Prozent des zweitbesten Beitrags.

71. Der gemeinsame Test machte das Ausmaß dieses Fortschritts auf eine Weise sichtbar, wie es vereinzelte Demonstrationen nicht hätten leisten können.

72. ImageNet bot zudem eine anspruchsvolle gemeinsame Aufgabenstellung, an der Software, Hardware-Einsatz und experimentelles Know-how verbessert werden konnten.

73. Sein Erfolg eröffnete Möglichkeiten, die weit über die Rangliste hinausgingen, darunter wiederverwendbare visuelle Darstellungen und Techniken, die an andere Aufgaben angepasst werden konnten.

74. Der nützliche Benchmark war zugleich ein selektives Prisma.

75. Die Kategorien von ImageNet übernahmen die Struktur und das Vokabular von WordNet, während die Organisatoren des Wettbewerbs zusätzliche Entscheidungen darüber trafen, welche Kategorien und Bilder einen praktikablen Wettbewerb ermöglichen würden.

76. Der bekannte Klassifizierungssatz mit 1.000 Klassen umfasste etwa 120 verschiedene Bezeichnungen für Hunderassen.

77. Die Unterscheidung einer Rasse von einer anderen ist ein legitimer Test für eine feinkörnige visuelle Klassifizierung, aber keine zeitlose Definition des maschinellen Sehens.

78. Dies hatte ungewöhnlich großes Gewicht, da diese Unterscheidungen zufällig in dem festen Kategoriensatz, der von einem einflussreichen Wettbewerb verwendet wurde, zahlreich vorkamen.

79. Ein System konnte an Rang verlieren, wenn es zwei ähnliche Rassen verwechselte, während es keine Abstrafung erhielt, wenn es in einer visuell wichtigen Kategorie versagte, die nicht in der Liste enthalten war.

80. Das ist kein Mangel, der durch die einfache Auswahl einer perfekten Liste hätte beseitigt werden können, da keine endliche Liste jede plausible Anwendung der Bildverarbeitung abdeckt.

81. Dies ist die unvermeidliche Folge der Operationalisierung einer weit gefassten Fähigkeit als endliche Aufgabe.

82. Die Schwierigkeit beginnt, wenn die für einen Test erforderliche Abgrenzung aus den Aussagen über das Ergebnis verschwindet.

83. Bildklassifizierung ist keine Objekterkennung, Lokalisierung ist kein Szenenverständnis, und die Leistung bei kuratierten Fotos ist nicht automatisch gleichbedeutend mit der Leistung bei jeder Kamera, jedem Klima oder jedem Einsatzort.

84. Die Organisatoren des Wettbewerbs haben diese Aufgaben selbst unterschieden und die Datensätze angepasst, als sich die Forschungsfragen änderten.

85. Ein sorgfältiges Benchmarking erfordert daher sowohl einen stabilen Kern als auch eine ehrliche Darstellung dessen, was darüber hinausgeht.

86. Stabilität ermöglicht es, dass sich Ergebnisse im Laufe der Zeit ansammeln.

87. Überarbeitungen verhindern, dass der gestern noch handhabbare Näherungswert zur unhinterfragten Definition von morgen wird.

88. In der Spannung zwischen diesen Vorzügen kommt die historische Pfadabhängigkeit ins Spiel.

89. Die Veröffentlichung eines Datensatzes ist lediglich ein Ereignis in der Vergangenheit, und das allein macht ein Forschungsgebiet noch nicht pfadabhängig.

90. Pfadabhängigkeit beginnt, wenn die Übernahme des Datensatzes die Kosten, die Sichtbarkeit oder die Wahrscheinlichkeit späterer Forschungsentscheidungen verändert.

91. Sobald viele Artikel denselben Wert angeben, kann ein neuer Artikel seine Relevanz dadurch begründen, dass er einer bekannten Tabelle eine Zeile hinzufügt.

92. Eine Arbeit über eine noch nicht benchmarkte Kapazität muss zunächst diese Kapazität begründen, die Daten zusammenstellen, die Metrik rechtfertigen und die Gutachter davon überzeugen, dass das Ergebnis mit irgendetwas vergleichbar ist.

93. Der alte Weg ist kostengünstiger, weil frühere Reisende für seine Anlage bezahlt haben.

94. Öffentlicher Code, Datenlader, Fehleranalysen, optimierte Baseline-Modelle, vortrainierte Modelle und Lehrmaterialien sammeln sich um den etablierten Test herum an.

95. Forschungslabore beschaffen sich Ausrüstung und Fachwissen, die für die Reproduktion ihrer Arbeitslasten geeignet sind.

96. Studierende wählen Fragestellungen aus, die innerhalb der Dauer eines Studiums zu einem anerkannten Ergebnis führen können.

97. Gutachter lernen, was als sinnvolle Verbesserung gilt, und diese Vertrautheit verringert den Erklärungsaufwand für Arbeiten, die demselben Format folgen.

98. Förderinstitutionen und Arbeitgeber können die Zahlen interpretieren, ohne jedes experimentelle Detail zu beherrschen, wodurch die im Benchmark ermittelte Leistung auch außerhalb des Labors an Wert gewinnt.

99. Jeder zusätzliche Nutzer macht den gemeinsamen Vergleich aussagekräftiger, sodass ein Benchmark einen Netzwerkeffekt entfalten kann.

100. Eine stärkere Nutzung führt zu mehr Referenzwerten und Werkzeugen; diese Ergänzungen senken die Kosten für die weitere Nutzung, und niedrigere Kosten ziehen noch mehr Nutzung an.

101. Diese positive Rückkopplung ist der eigentliche Mechanismus, durch den eine frühe Messentscheidung den späteren Möglichkeitenraum eines Fachgebiets neu ausrichten kann.

102. Alternativen werden nicht physikalisch unmöglich.

103. Sie werden weniger sichtbar, weniger vergleichbar und ihre Umsetzung wird teurer.

104. Das Ersetzen eines fest etablierten Benchmarks kann neue Datenerhebungen, neue Annotationen, neue Auswertungssoftware, die erneute Ausführung älterer Systeme sowie die Koordination zwischen Gruppen erfordern, die nicht alle gleichermaßen von der Änderung profitieren.

105. Dies sind Umstellungskosten, die eher durch die Geschichte der Einführung als durch die intrinsische Überlegenheit der ursprünglichen Aufgabe entstehen.

106. Doch genau diese ergänzenden Investitionen schaffen auch den enormen Wert des Benchmarks.

107. Ein stabiler Standard bewahrt das gemeinsame Gedächtnis, schützt frühere experimentelle Arbeiten und ermöglicht es einem kleinen Labor, sich mit viel größeren zu vergleichen.

108. Dies ist sowohl eine nützliche als auch eine einschränkende Bindung.

109. Dies als „Lock-in“ zu bezeichnen, bedeutet nicht, dass Veränderungen unmöglich sind oder dass die ursprüngliche Entscheidung unklug war.

110. Es bedeutet, dass die heutige Auswahl an realisierbaren Forschungsfragen teilweise von der gestrigen Koordination abhängt.

111. Auch löst nicht jeder Benchmark einen solchen Prozess aus.

112. Umfangreiche Übersichtsstudien zu Benchmarks in den Bereichen Computer Vision und Sprachverarbeitung zeigen, dass viele nie eine breite Anwendung finden, während viele andere schnell die Sättigungsgrenze erreichen.

113. Ein Datensatz kann veröffentlicht, kurz zitiert und wieder vergessen werden, ohne dass er ein Fachgebiet neu ordnet.

114. Er wird erst dann zu einem Weg, wenn seine wiederholte Nutzung verstärkende technische, soziale und institutionelle Investitionen um ihn herum aufbaut.

115. Dieses Gegenbeispiel ist wichtig, weil es den historischen Ursprung von echter Pfadabhängigkeit trennt.

116. Der Netflix-Preis offenbart eine andere Grenze des Erfolgs von Benchmarks.

117. Im Jahr 2006 lobte Netflix eine Million Dollar für eine zehnprozentige Verbesserung gegenüber seinem bestehenden System bei der Vorhersage von Nutzer-Filmbewertungen aus.

118. Der Wettbewerb operationalisierte dieses Ziel anhand des mittleren quadratischen Fehlers, einer statistischen Größe, die die Abweichung zwischen einer vorhergesagten Sternebewertung und der tatsächlich von einem Nutzer abgegebenen Bewertung abstrafte.

119. Dieser Indikator war präzise, ließ sich automatisch auswerten und eignete sich für einen Wettbewerb, an dem Forscher weit außerhalb des Unternehmens teilnahmen.

120. Über einen Zeitraum von fast drei Jahren entwickelten die Teilnehmer wichtige Methoden für Empfehlungssysteme und kombinierten zahlreiche Modelle, um auch die letzten Bruchteile einer Verbesserung zu erzielen.

121. Das Gewinnerteam überschritt die festgelegte Schwelle und erhielt 2009 den Preis.

122. Netflix berichtete später, dass das endgültige Ensemble Hunderte von Vorhersagemodellen miteinander kombinierte.

123. Die Ingenieure bewerteten einige der neuen Methoden offline, kamen jedoch zu dem Schluss, dass die zusätzliche Genauigkeit den Aufwand, der für die Einführung in die Produktion erforderlich gewesen wäre, nicht rechtfertigte.

124. Zu diesem Zeitpunkt hatte sich die Personalisierungsarbeit des Unternehmens zudem über die Vorhersage von Sternebewertungen hinaus auf die Rangfolge und Anordnung der Inhalte ausgeweitet, die sich die Mitglieder tatsächlich ansehen könnten.

125. Die pauschale Behauptung, Netflix habe keine der im Rahmen des Wettbewerbs entwickelten Arbeiten genutzt, ist falsch, da zwei leistungsstarke Teilansätze aus einem früheren „Progress-Prize“-Modell angepasst und eingesetzt wurden.

126. Die letzte Verbesserung der Wettbewerbsmetrik war es, die den umfassenderen Produktionstest nicht bestand.

127. Betriebskosten, Aktualisierungsgeschwindigkeit, technische Komplexität, Schnittstellendesign und die Konsequenzen einer tatsächlichen Auswahl beim Anschauen waren für den Dienst allesamt von Bedeutung, obwohl sie nicht Teil der Wettbewerbswertung waren.

128. Der Wettbewerb hat diese Aspekte nicht schlecht gemessen.

129. Er war darauf ausgelegt, etwas Engeres zu messen.

130. Die Teilnehmer handelten rational, als sie das veröffentlichte Kriterium optimierten, und Netflix handelte rational, als es später eine breitere Palette von Kosten und Zielen bewertete.

131. Die Episode zeigt daher nicht, dass Benchmarks nutzlos sind oder dass numerischer Fortschritt vorgetäuscht ist.

132. Sie zeigt, dass eine echte Verbesserung eines Indikators ein unzureichender Beweis für eine Verbesserung des übergeordneten Systems bleiben kann, für dessen Darstellung der Indikator ausgewählt wurde.

133. Sie zeigt auch, dass ein Weg geändert und nicht für immer befolgt wird, da die Organisation ihre Aufmerksamkeit umlenken konnte, als sich der Dienst und seine Fragestellungen änderten.

134. Ein ausgereifter Benchmark entwickelt andere charakteristische Probleme.

135. Eines davon ist die Sättigung, das Annähern an eine Obergrenze, bei der nahezu jedes seriöse System nahezu jede Testfrage korrekt beantwortet.

136. In der Nähe dieser Obergrenze können winzige Punktunterschiede stark von Annotationsfehlern, mehrdeutigen Fällen oder zufälligen Schwankungen abhängen.

137. Das allgemeine Problem kann weiterhin bestehen bleiben, selbst wenn der festgelegte Test die Methoden nicht mehr gut voneinander unterscheidet.

138. Forscher reagieren darauf oft mit der Entwicklung eines schwierigeren Benchmarks.

139. Der Nachfolger kann eine wirklich neue Richtung einschlagen, indem er die Datenverteilung ändert, bisher vernachlässigte Fähigkeiten hinzufügt oder das Verhalten unter weniger kontrollierten Bedingungen testet.

140. Er kann aber auch die Annahmen des Vorgängers übernehmen, indem er dieselben Kategorien, dasselbe Antwortformat und dieselbe Hauptmetrik beibehält und lediglich den Schwierigkeitsgrad erhöht.

141. Schwierigere Fragen im gleichen Format verlängern eher den bestehenden Weg, als dass sie ein neues Ziel aufzeigen.

142. Die Übernahme ist attraktiv, da alte Werkzeuge und Referenzwerte wiederverwendet werden können.

143. Ein radikalerer Test opfert einen Teil der Kontinuität und erfordert den Aufbau einer neuen Vergleichsgemeinschaft.

144. Die Geschichte des alten Benchmarks beeinflusst somit, welcher Ersatz am kostengünstigsten ist, selbst wenn sich alle einig sind, dass ein Ersatz notwendig ist.

145. Ein zweites Problem ist das Überanpassen auf der Ebene einer Forschungsgemeinschaft.

146. Ein Team trainiert vielleicht nie direkt auf dem offiziellen Testdatensatz und trifft dennoch wiederholt bestimmte Designentscheidungen, nachdem es jahrelange Ergebnisse auf demselben Benchmark gesehen hat.

147. Über viele Teams und Veröffentlichungen hinweg passen sich Architekturen, Vorverarbeitungsschritte und Trainingsrezepte an die stabilen Besonderheiten des Tests an.

148. Verbesserungen der Punktzahlen können dann spezifischer für diesen Benchmark sein, als ihre allgemeine Interpretation vermuten lässt.

149. Dies unterscheidet sich von gewöhnlichem Überanpassen innerhalb eines einzelnen Experiments, bei dem ein Modell seine Trainingsbeispiele lernt, aber bei neuen Beispielen, die für dieselbe beabsichtigte Aufgabe entnommen wurden, schlecht abschneidet.

150. Das Überanpassen an Benchmarks auf Gemeinschaftsebene betrifft die wiederholte Auswahl ganzer Methoden anhand eines öffentlichen Ziels, bis das Fachgebiet die Regelmäßigkeiten des Tests erlernt hat.

151. Beide Probleme schwächen die Rückschlüsse von einem gemeldeten Ergebnis auf die Leistung in anderen Kontexten, entstehen jedoch aus unterschiedlichen Hintergründen.

152. Ein drittes Problem ist die Kontamination.

153. Wenn eine öffentliche Testaufgabe in die Trainingsdaten eines Modells gelangt, misst die Bewertung nicht mehr eindeutig die Leistung bei bisher unbekanntem Material.

154. Das Risiko lässt sich besonders schwer bei Sprachmodellen überprüfen, die auf sehr großen Sammlungen öffentlicher Texte trainiert wurden, da der Benchmark selbst, Diskussionen darüber oder erkennbare Varianten in diesen Sammlungen vorkommen können.

155. Die bloße Exposition garantiert kein Auswendiglernen, und die Kontamination erhöht nicht jedes Ergebnis um denselben Betrag.

156. Sie widerlegt jedoch die einfache Annahme, dass jedes veröffentlichte Testbeispiel aus dem Training ausgeschlossen blieb.

157. Geschützte Testsätze, erneuerte Fragen, Herkunftsnachweise und statistische Erkennungsmethoden können das Problem mindern oder aufdecken.

158. Jede Abhilfemaßnahme ist mit Kosten verbunden, da Geheimhaltung die Überprüfung behindert, Erneuerung den Vergleich über die Zeit hinweg schwächt und Herkunftsnachweise unvollständig sein können.

159. Die Pflege von Benchmarks ist daher eine fortlaufende Aufgabe und kein einmaliger Vorgang der Veröffentlichung von Datensätzen.

160. Selbst einem nicht kontaminierten und nicht gesättigten Test kann es an ökologischer Validität mangeln.

161. Ein System mag sich zwar bei der Auswahl einer Antwort aus einer vorgegebenen Liste auszeichnen, hat jedoch Schwierigkeiten, wenn es klärende Fragen stellen, Unterbrechungen überwinden oder erkennen muss, dass keine der angebotenen Antworten passt.

162. Ein Bildverarbeitungsmodell, das an zentrierten Fotos getestet wurde, kann mit Unordnung, ungewöhnlichen Blickwinkeln, wechselnden Lichtverhältnissen, beschädigten Sensoren oder Kategorien konfrontiert werden, die im Bewertungsdatensatz nie vertreten waren.

163. Zuverlässigkeit bei Verteilungsverschiebungen, die Kalibrierung des Konfidenzniveaus, Reaktionszeit, Energieverbrauch, Wartungsaufwand und die Fähigkeit, sicher auszufallen, können bei der Bereitstellung allesamt von Bedeutung sein.

164. Einige dieser Eigenschaften sind messbar, doch würden sie alle in einer einzigen Bewertung zusammengefasst, würden Konflikte zwischen ihnen verschleiert statt beseitigt.

165. Ein Datensatz wählt aus, welche Situationen zählen, eine Metrik gewichtet verschiedene Fehler, und eine Rangfolge entscheidet darüber, wie mehrere Ergebnisse sichtbar gemacht werden.

166. Ändert man eine dieser Entscheidungen, können zwei Systeme die Plätze tauschen, ohne dass sich eines der Systeme überhaupt ändert.

167. Diese Umkehrung beweist nicht, dass die Messung willkürlich ist.

168. Sie beweist, dass Leistung immer Leistung in Bezug auf bestimmte Fälle und Konsequenzen bedeutet.

169. Was ein Benchmark auslässt, hört nicht buchstäblich auf, als Forschungsgegenstand zu existieren.

170. Es wird schwieriger, dies darzustellen, zu vergleichen, zu veröffentlichen und zu belohnen, was eine Vernachlässigung wahrscheinlicher machen kann.

171. Eine Sprache mit wenigen beschrifteten Daten oder ohne vertrauenswürdigen Bewertungsdatensatz ist nicht unfähig zu technischem Fortschritt, aber das Aufzeigen und Zusammenfassen dieses Fortschritts ist mit höheren Kosten verbunden.

172. An diesem Punkt treffen Logistik und Werte aufeinander.

173. Automatisch bewertete Aufgaben werden unter anderem deshalb bevorzugt, weil sie kostengünstig, wiederholbar und skalierbar sind, während Beurteilungen, die menschliche Experten erfordern, langsamer sind und je nach Bewerter variieren können.

174. Diese praktischen Unterschiede sind real, doch die Entscheidung für Bequemlichkeit verteilt die Aufmerksamkeit auch auf verschiedene Fähigkeiten, Nutzer und Umgebungen.

175. Die Verengung ist ein Kompromiss, bevor sie zu einer Pfadabhängigkeit wird.

176. Sie wird erst dann pfadabhängig, wenn wiederholte Investitionen eine spätere Erweiterung oder Neuausrichtung kostspieliger machen, als es zu Beginn der Fall gewesen wäre.

177. Gemeinschaften können sich Handlungsspielraum bewahren, indem sie mehrere Benchmarks pflegen, Testmaterial aktualisieren, mehr als eine Kennzahl ausweisen, Fehler überprüfen und Leistungen außerhalb der vorherrschenden Verteilung vergleichen.

178. Keine dieser Vorgehensweisen liefert ein vollständiges Bild, und ein umfangreiches Dashboard kann ebenso ritualisiert werden wie eine einzelne Zahl in einer Rangliste.

179. Mehrere Messgrößen sind nicht deshalb nützlich, weil sie das Urteilsvermögen überflüssig machen, sondern weil sie unvereinbare Ziele sichtbar halten.

180. Alte Benchmarks können als historische Koordinaten bestehen bleiben, während neue Bewertungen Bereiche ausloten, die die alte Aufgabe nicht abbilden konnte.

181. Diese Anordnung bewahrt die Vergleichbarkeit, ohne einem überlieferten Test dauerhafte Autorität über die Richtung des Fachgebiets einzuräumen.

182. Sie bewahrt auch die Entwicklungsfähigkeit, da Forscher mehr als einen anerkannten Weg beibehalten, auf dem ein Beitrag von Bedeutung sein kann.

183. Die folgenreichsten Entscheidungen bezüglich Benchmarks sind daher nicht nur die späteren Entscheidungen darüber, wie eine Punktzahl verbessert werden kann.

184. Es sind die früheren Entscheidungen darüber, was getestet werden soll, wie es bewertet werden soll und wann die kumulierte Vergleichbarkeit die Kosten der Kontinuität wert ist.

185. Diese Entscheidungen werden manchmal von kleinen Teams getroffen, die ein unmittelbares praktisches Problem lösen, können aber auch aus langen Beratungen und wiederholten Überarbeitungen hervorgehen.

186. In beiden Fällen hängt ihre Reichweite weniger von der Autorität ihrer Urheber ab als vielmehr von dem Netzwerk aus Nutzern und Ergänzungen, das sich um sie herum entwickelt.

187. Der in die Kirchenwand geritzte Pfeil macht eine bewusst bescheidene Aussage über die Höhe eines Punktes innerhalb eines Referenzsystems.

188. Er ermöglicht es späteren Vermessern, auf dieselbe Höhe zurückzukehren, ohne so zu tun, als sei die Höhe die einzige Eigenschaft der Landschaft.

189. Ein Forschungsmaßstab kann dieselbe disziplinierte Kontinuität bieten, wenn seine Grenzen sichtbar bleiben.

190. Sobald sich jedoch Karrieren, Codes, Ausrüstung und Erwartungen um seinen Wert herum ansammeln, beginnt die Markierung als Wegweiser zu fungieren.

191. Die tiefste Verkrustung liegt nicht in der Zahl selbst, sondern in dem Geflecht aus Arbeit, das es billiger macht, eine geerbte Frage weiter zu beantworten, als eine andere zu stellen.

Dieser Text steht unter CC0 1.0 Universell. Eine Quellenangabe ist nicht erforderlich.
Er darf kostenlos kopiert, verändert, veröffentlicht und auch kommerziell genutzt werden.