Archive for the ‘Kevin Bacon’ Category

Weil man damals nicht viel sah (und immer noch nicht viel sieht), wenn man sich alles auf einmal anschaut bzw. nur das bisschen was um den Ursprung rum passiert, normierte ich die Matrizen.
Kurz zur Wiederholung: Normierung bedeutet in diesem Fall, dass ich alle Werte einer Spalte durch den grøszten Wert in besagter Spalte dividiere. Dadurch wird die maximale Intensitaet auf eins festgesetzt und alle Spalten haben den selben maximalen Wert (nur eben (mglw.) an anderen Stellen).

Durch die Normierung wurde das viele Schwarz zumindest teilweise deutlich farbenfroher und man konnte viel mehr von dem sehen was eigentlich passiert. Das Wort „teilweise“ bezieht sich darauf, dass sich die Farben immer noch nahe der Abzsisse „tuemmelten“ … weswegen die Bilder hier und heute zwar den gesamten Definitionsbereich zeigen, auf der Ordinate aber nur bis zum Wert 200 gehen.

Und los geht’s wieder mit dem Reproduzierbarkeitsteil — das Zitate-ueber-Zitate Bild (mit normierten Spalten):

Bis auf eine Ausnahme passiert nix Wesentliches. Vielleicht gibt es ein Muster in den Bildern, ich denke aber, dass die Laenge und Intensitaet der einzelnen Spalten zufaellig ist. Das nennt man auch „Rauschen“ und Rauschen veraendert sich nunmal ueber die Zeit.
Die Ausnahme ist der helle Streifen in den 2020-Daten bei einer Zitategruppe von ca. 2600. Der ist entweder nicht mehr existent in den 2023 Daten, oder hat sich deutlich nach rechts, in die Naehe von Zitategruppe 5000 verschoben. Auch wenn ich das nicht geprueft habe, so denke ich nicht, dass Ersteres zutrifft. Der Grund liegt darin, dass sich der helle Streifen damals als zur Seite CinemaScore gehørend herausstellte. Die ist zu wichtig um einfach zu verschwinden. Auszerdem stellte sich damals auch heraus, dass die Art und Weise wann besagte Seite zitiert wird etwas speziell ist und dieses Spezielle kønnte eine deutlich høhere Anzahl an Zitaten drei Jahre spaeter durchaus mit einschlieszen.

Das schlieszt den Reproduzierbarkeitsteil ab und wie beim letzten Mal gehe ich sofort zum Links-ueber-Zitate Bild (mit normierten Spalten) ueber:

Das ist ja nun etwas komplett Neues, aber ich denke, dass man auch hier wieder vor allem Rauschen und Veraenderungen darin sieht.
Im Vergleich zum (spaltennormierten) Zitate-ueber-Zitate Bild ist es interessant, dass der helle Bereich nicht auf nur ein paar wenige Reihen nahe der Abzsisse konzentriert ist sondern sich ueber fast 30 Reihen ausdehnt. Ebenso ist der „Start“ des hellen Bereichs um ca. 10 Reihen nach oben verschoben. Und dann sind da noch zwei „Artefakte“ (?); zwei Steifen die sich etwas nach rechts ziehen. Einer in Reihe 13 oder 14 der von Zitategruppe 0 bis ca. 500 / 600 reicht und ein zweiter, schwaecherer zwischen den Reihen 32 und 36, von ca. Zitategruppe 200 bis ca. 1200.
Ich lass das alles jetzt einfach so stehen und mache da nix weiter mit.

Vielmehr gehe ich direkt ueber zum Links-ueber-Links-Bild (mit normierten Spalten)

Im Wesentlichen wieder nur Rauschen. Es gibt aber eine Abweichung die von groszem Interesse ist: der helle Bereich laeuft nicht ueber die gesamte Abzsisse. Vielmehr wird dieser „schwaecher“ ab ca. Linksgruppe 700 und ist nur noch sehr schwach, mit vielen Unterbrechungen ab ca. Linksgruppe 1100.
Das bedeutet ja, dass Seiten mit vielen Links, NICHT am haeufigsten von Seiten mit wenigen Links zitiert werden, denn dann wuerde der helle Bereich sich komplett durchziehen. Vielmehr scheint es so, dass solche Seiten von anderen Seiten mit zum Teil deutlich mehr als 50 Links zitiert werden. Letzteres ist aber nicht systematisch und deshalb sind die hellen Pixel (also das Maximum einer Spalte) bei Seiten in Linksgruppen ueber ca. 1100 zu groszen Teilen wie die Sternen am Himmel (also zufaellig) verteilt. Ich komme ganz am Ende darauf zurueck.

Als (vor)letztes das Zitate-ueber-Links-Bild (mit normierten Spalten):

Ah ja … sieht im Wesentlichen aus wie erwartet — eine Mischung der oben diskutierten und gezeigten Phaenomene. Der helle Bereich ist wieder schmal und nahe der Abzsisse (weil die Ordinate die Zitategruppe darstellt) und weil auf der Abzsisse die Linksgruppen abgetragen sind, tritt auch hier der „Sternenhimmel“ auf. Deswegen schreibe ich da niz weiter zu.
„Komisch“ sind in den 2020-Daten nur die duennen vertikalen Streifen die um Zitategruppe 110 (auf der Ordinate) auftreten. Die sieht man zwar nicht mehr, wenn man sich das Links-ueber-Links Bild (mit normierten Spalten) der 2020-Daten ohne „abgeschnittene“ Ordinate anschaut …

 

… aber deren „grosze Bruder“ tauchen bei ungefaehr Linksgruppe 700 auf der Ordinate auf! Ich habe da keine Erklaerung fuer, denn ich habe das nicht weiter untersucht, es sieht aber dem „Blob“ von damals erstaunlich aehnlich. Nur dass ich damals noch deutlich mehr als eine Normierung machen musste um ueberhaupt auf diese Anomalie aufmerksam zu werden, und beim „neuen Werkzeug“ faellt das einfach so raus.
Es scheint sich hierbei um eine Art „Linksphaenomen“ zu handeln, denn ich sehe das NICHT in den Bildern bei denen die Abzsisse die Zitategruppen praesentiert. Auch hier wieder: das soll reichen und es folgt nix weiter.

Abschlieszend kann ich auch dieses mal sagen: cool wa! Das neue Werkzeug „keeps on giving“. Das war’s aber noch nicht, denn weil es zu viel geworden waere, bekommen die reihenweise normierten Bilder ihren eigenen Beitrag (den naechsten).

Nach der nøtigen Verallgemeinerung vom letzten Mal kann ich endlich zu den zweidimensionalen Falschfarbenbildern kommen. Nur eine kleine Sache muss ich noch erwaehnen. Meine Lieblingsfarbpalette fuer Falschfarbenbilder hat gewisse Probleme (in kurz: sie luegt mich an und gaukelt mir Sachen vor die gar nicht da sind; schau bspw. hier, etwas technischer hier). Ich wusste davon seit einigen Jahren. Dinge die einem am Herzen liegen, gibt man nur nicht so schnell auf. Aber nun endlich habe ich mich dazu durchgerungen eine andere Farbpalette zu benutzen, die nicht mit diesen Problemen einher kommt.

Hier ein Vergleich von alt und neu:

Es ist gerade noch nicht so wichtig, was man da sieht (denn ich komme gleich darauf zurueck). Wichtig ist, dass die Farbpalette von blau bis rot im hellgruenen Bereich eine viel høhere Intensitaet vermuten laeszt, als tatsaechlich da ist. Das ist nur das auffaelligste Merkmal (es gibt noch andere, wenn man genau hinschaut) und ich werde hier nicht darauf eingehen, inwiefern das Information hinzufuegt, die so nicht vorliegt. Aber all das tritt bei Benutzung der neuen Farbpalette nicht mehr auf.

Das soll dazu reichen und ich gehe sofort zum eigentlichen Thema ueber: Falschfarbenbilder die zeigen welche Seiten von welchen anderen Seiten zitiert werden.
Bereits damals stellte ich fest, dass man im Wesentlichen nur schwarz sieht (Wortspielkasse), wenn man sich alles anschaut und die „Action“ um den Ursprung herum passiert. Daran hat sich auch mit den 2023-Daten nix geaendert und deswegen zeige ich hier nur Bilder die sich auf die ersten hundert Bedeutungsgruppen (zum Quadrat) konzentrieren.

Fuer den Reproduzierbarkeitsteil (aber mit neuen Farben) der Vergleich des Zitate-ueber-Zitate-Bildes:

„OI! Da aendert sich doch aber gewaltig viel!“ kønnte man da sagen, denn die Intensitaet nimmt stark ab. Ihr meine lieben und aufmerksamen Leserinnen und Leser seht aber sicherlich sofort, dass sich auch die Farbskala gewaltig aendert. Und wenn man das vergleicht, dann ist das doch sehr aehnlich.
Der Grund fuer die viel weiter reichende Farbskala bei den 2023-Daten liegt in der einen Wikipedia Hauptseite die insgesamt ueber 5 Millionen Zitate erhaelt und in den 2020-Daten nicht dabei ist. Das ist buchstaeblich nur die allerletzte Spalte, und auch da nur ca. die ersten 23 Pixel, die den kompletten (Farb)Bereich voll ausnutzen. Die Farbwerte (aber nicht die Zahlenwerte) aller anderen Pixel ist dementsprechend herunter gesetzt. Die Aenderung ist somit ein technisches Artefakt und liegt nicht an den allgemeinen (!) 2023-Daten an sich. Wenn man besagte Hauptseite (und noch eine zweite Seite mit ueber 1 Million Zitaten, bei der ich aber nicht schaute um was es sich dabei handelt) entfernt, ist alles im Wesentlichen wie vorher. Und hier ist das entfernen vøllig OK, da es sich ja im einen tatsaechlichen Ausreiszer handelt, der gar nichts ueber die generelle Situation aussagt.

Von dem leicht zu korrigierenden, technischen Artefakt abgesehen passiert auch bei den 2023-Daten nicht viel. Das Intensitaetsmaximum liegt beide Male um 3 Zitate auf der Abzsisse und 1 Zitat auf der Ordinate und der leuchtende „Blob“ zieht sich parallel zur x-Achse ein wenig in die Laenge und bildet einen „duennen Schwanz“ aus.

Wenn man sich aber das Links-ueber-Zitate Bild anschaut wird’s in den 2020-Daten spannend:

Zum Einen verteilt sich die „Action“ mehr; der „Blob“ ist viel ausgedehnter. Zum Zweiten leigt das Maximum bei ungefahr 4 Zitaten auf der Abzisse und ungefaehr 11 Links auf der Ordinate. Zum Dritten dehnt sich der „Blob“ zwar relativ gleichmaeszig entlang beider Achsen aus, scheint die Richtung parallel zur Ordinate aber ein klein wenig zu bevorzugen. All das ist voll aufregend und gehørt untersucht. Aber nicht (mehr) von mir und nicht an dieser Stelle.
Abschlieszend zu diesem Bild ist wieder nur zu sagen, dass es keinen Unterschied in den 2023-Daten gibt. Die Aenderung der Intensitaet ist auch hier wieder nur ein Artefakt.

Auf zum Links-ueber-Links Bild:

Ich gehe jetzt nicht im Detail auf alle Merkmale ein, an den 2020-Daten sieht man aber leicht, dass es noch andere Informationen offenbart als beide vorherigen Darstellungen.
Interessant ist die helle, unterbrochene Linie, parallel zur Abzsisse, bei 12 Links auf der Ordinate. Dort treten etliche Pixel _deutlich_ hervor. Das ist bestimmt ein weiteres Artefakt und es wuerde mich nicht wundern, wenn es sich dabei um Seiten handelt, die ich hier als „Information Operations“ bezeichnete. Diesmal liegt das Artefakt aber nicht in der Darstellung, sondern in den Daten … andererseits dachte ich auch beim „São-Paulo-FC“-Phaenomen, dass es sich dabei um ein Artefakt handelt und das stellte sich dann nur als extremste Ausfuehrung einer systematischen Sache heraus.

An dieser Linie sieht man auch die einzigen zwei echten Unterschiede zu den 2023-Daten. Zum Einen scheint die Linie um eins nach oben zu „springen“. Ich wuerde zunaechst nicht ausschlieszen, dass ich da einen Fehler gemacht habe. Denke aber nicht, dass dem so ist.
Vielmehr vermute ich, dass der Hintergrund wieder die Wikipedia Hauptseite ist. Ein Link dahin scheint bei den 2023-Daten in (fast) allen Seiten drin zu sein (denn andernfalls haette die nicht so viele Zitate). Wenn besagter Link zwischen Ende 2020 und Ende 2023 automatisch zu allen Seiten hinzugefuegt wurde, heiszt das ebenso, dass die Anzahl der Links aller Seiten um eins nach oben geht. Das wuerde die hier nicht mal erwaehnte, weil so schwache, ganz leichte Verschiebung der roten Kurve erklaeren … wenn man genau hinschaut, scheinen dort alle Seiten um eins nach rechts gehuepft zu sein. Aber auch das werde ich mir nicht weiter anschauen … ich erwaehnte es nur als plausiblen Mechanismus, der die Unterschiede einfach erklaeren wuerde.
An der Linie sieht man noch einen weiteren Unterschied: die Position der hellen Punkte verschiebt sich auch entlang der Linie (bzw. verschwinden diese zum Teil vøllig). Das sieht mir nach ’ner „Hausmeisteraktion“ bei der Wikipedia aus, bei der bspw. „Information Operations“-Seiten geløscht wurden. Ein paar solcher Seiten konnten „entkommen“, bzw. rutschten vermutlich gerade unter die Erkennungsgrenze die fuer solche Seiten festgelegt wurde.

Und nun noch schnell das Zitate-ueber-Links Bild:

Man sieht an den 2020-Daten, dass es von allen drei neuen Achsenbedeutungskombinationen am meisten dem Zitate-ueber-Zitate Bild zu aehneln scheint. Es gibt aber Unterschiede die sich lohnen naeher zu betrachten … ihr, meine lieben Leser und Leserinnen ahnt es aber sicherlich schon: das wird nicht hier passieren und auch nicht (mehr) von mir gemacht werden.

Das soll reichen fuer heute. Ich møchte nur noch erwaehnen, dass erst dieses (neue) Werkzeug das (obige) Fuellhorn an Informationen zur Verfuegung gestellt hat. Das ist so’n bisschen wie damals (also ganz damals, viel frueher als mein Kevin-Bacon-damals) beim Mikroskop; die Informationen waren ja die ganze Zeit schon da, ich hab die nur (fast) nicht gesehen, weil ich die nicht „im richtigen Lichte“ betrachtet habe, weil mir bis vor Kurzem das richtige Werkzeug dazu fehlte.

Cool wa … das was eigentlich nur als Reproduzierbarkeit des ganzen Krams gedacht war hat (schon wieder) was Neues hervorgebracht. Wie ich es schon øfter erlebte, lohnt es sich sehr, am Ende nochmals auf eine Sache zu schauen mit der man sich laengere Zeit beschaeftigte. Denn dann kennt man viele der Details und wenn man das „Bild“ dann aus grøszerem Abstand anschaut, sieht man neue Sachen, die man vorher nicht sehen konnte, weil man eben diese Details noch nicht kannte. Aber ich fange an mich im Kreis zu bewegen und mache deswegen nun wirklich Schluss fuer heute.

Ohne lange Vorrede, knuepfe ich recht direkt beim letzten Mal an.
Urspruenglich schaute ich nur auf die Zitate die eine Wikipediaseite auf sich vereinte und betrachtete diese als ein Masz fuer die „Relevanz“ besagter Seite. Ich definierte (nicht formal, aber irgendwie schon) dann, dass der „Relevanzwert“ eine Art „Projektion“ der Anzahl der Zitate auf eine kontinuierliche Verteilung ist. Hier bin ich damals naeher darauf eingegangen; dennoch zur Wiederholung zwei kurze Beispiele.
– Seiten mit wenigen Zitaten werden 1:1 „projiziert“. Es gibt Seiten mit, zwei, drei, vier, oder fuenf Zitaten und deren „Relevanzwert“ entspricht dann auch 2, 3, 4 oder 5.
– Bei vielen Zitaten kommt es aber zu Luecken. Bspw. kønnte es (eine) Seite(n) mit 235 Zitaten geben, was dann (noch) einem „Relevanzwert von 235 entspricht. Wenn es nun keine Seiten mit 236 oder 237 Zitaten gibt (eine Luecke) sondern erst wieder mit 239 Zitaten, so werden Letztere einem „Relevanzwert“ von 236 (ohne Luecke!) zugeordnet.

Soweit zur Auffrischung alter Sachen. Aber eigentlich will ich vom Begriff „Relevanzwert“ weg kommen. Der Grund liegt in dem was ich beim letzten Mal schrieb: auch die Anzahl der Links die eine Seite hat ist von Interesse. Die kønnen aber nicht mehr (oder vielmehr nicht auch) als Relevanzwert angesehen werden. Dennoch møchte ich gerne zwischen Anzahl Zitaten und Anzahl Links unterscheiden kønnen.
Das oben beschriebene Prinzip hilft aus dem Dilemma heraus, denn alle Seiten welche die selbe Anzahl an Zitaten / Links haben (je nachdem, was man betrachtet) werden in eine Gruppe „geschmissen“. Und das was dann auf der jeweiligen Achse des zweidimensionalen Falschfarbenbildes abgetragen ist, entspricht der Bedeutung der Achse. Somit kommt man leicht zu den Bedeutungsgruppen, bzw. ganz konkret: Zitategruppen bzw. Linksgruppen. Am Prinzip aendert sich aber nix, nur der Name ist anders und die Interpretation bzgl. dessen fuer was besagtes Prinzip steht ist verallgemeinert worden.

An der Stelle kann ich mich um den Reproduzierbarkeitsteil des Anhangs kuemmern. Fuer die Daten von 2020 gab es nur 5,696 verschiedene Møglichkeiten wieviele Zitate eine Seite haben konnte. Weil man bei der Null anfaengt zu zaehlen (denn es gibt Seiten die keine Zitate haben), entspricht das einem høchsten Relevanzwert von 5,695. Hier ist der Vergleich mit den Daten von 2023:

Man sieht, dass sich die 2023 Daten (rote Punkte) ab ca. 3-tausend Zitaten ueber die 2020-Daten erheben. Die Vielfalt in der Anzahl der Zitate die eine Seite haben kann ist also grøszer in den neueren Daten (und damit steigt die Anzahl der Zitategruppen). Wie oben erwaehnt, werden Seiten mit wenigen Zitaten 1:1 auf die entsprechende Gruppe „projiziert“ … am Grafen kann man ablesen, dass „wenig“ bis ca. 3-tausend Zitate bedeutet.
Insgesamt gibt es in den 2023-Daten 6164 Zitategruppen, also nicht ganz 500 mehr als in den 2020-Daten.

Die S-Form hat nix zu sagen und kommt durch die halblogarithmische Darstellung zustande. Diese waehlte ich aus zwei Gruenden. Zum Einen, weil eine Seite (es ist die Hauptseite … ich frage mich uebrigens, warum die nie in den 2020-Daten auftauchte … vielleicht hat sich seitdem was in der Wikipedia an sich geaendert … oh … ich schwoffte ab) ueber 5 Millionen Zitate erhaelt und man bei linearer Abzsisse nix Relevantes sehen wuerde (nur eine Kurve die senkrecht nach oben geht und dann flach verlaeuft). Zum Zweiten, weil es bei einer logarithmischen Ordinatebei hohen Zitategruppen(zahlen?) zur „logarithmischer Komprimierung“ kommt und man dadurch auch wieder nix Relevantes (naemlich den Unterschied) sieht.

Alles in allem wuerde ich dies als reproduziert ansehen. Die Aenderung der Anzahl der Zitategruppen war zu erwarten und die Aenderung liegt jetzt nicht vøllig wild ganz woanders (bei 5 Trillionen oder so … oder auch nur ’nem Faktor 2 wenn man mal drueber nachdenkt).

Und nun kommt was Neues … und Altes was aber auch neu ist, weil ich’s vorher noch nicht gezeigt hatte: die „Projektion“ der Anzahl der Links die eine Seite haben kann auf die Linksgruppen:

Man beachte die andere Skalierung! Weil die Anzahl der Links nicht so hohe ExtremMaximalwerte hat, konnte ich beide Achsen linear belassen. Man kann aber erahnen, was ich oben mit „senkrecht nach oben und dann flach“ meine; bzw. wie nuetzlich die „logarithmische Komprimierung“ ist … aber das zog sich ja immer wieder durch diese Serie. Desweiteren sieht man eine andere, bereits erwaehnte Sache: bis ca. 1500 Links ist der Anstieg der Kurve linear und das entspricht einer (im Wesentlichen) 1:1 „Projektion“.
Ansonsten ist nur noch zu sagen, dass die Anzahl der Linksgruppen nur ca. 1/3 der Anzahl der Zitategruppen betraegt und dass besagte Anzahl auch hier (leicht) zunimmt in den 2023-Daten.
Alles in allem ist das zwar neu, aber gleichzeitig auch eine Reproduktion … toll wa! Der fruehe Wurm faengt gleich zwei Spatzen auf dem Dach :) .

Juti … das soll reichen fuer heute. Beim naechsten Mal … … … *ueberleg* … … … gibt’s dann endlich wieder bunte Bilder. Da muss ich aber noch ueberlegen, wie ich das aufziehe.

Beim letzten Mal war ich mir noch unsicher, ob ich versuche die Relevanzbetrachtungen zu reproduzieren. Ich dachte, dass man da ohnehin nix sieht. Aber dann packte mich (mal wieder) mein Ehrgeiz und es passierte etwas Aehnlichs wie bei der Simulation von Namen.
Oder vielmehr passierte viel mehr, denn ich schrieb nicht nur den entsprechenden Programmcode neu. Denn beim Neuschreiben verallgemeinerte ich auch alles und entdeckte dabei, dass die Relevanzdiskussion nur ein spezifischer Fall ist, wie die Daten auf diese Art betrachtet werden kønnen. Deswegen der Reihe nach …

… und los geht’s gleich mit dem was eigentlich betrachtetet wird.
Damals interpretierte ich die Anzahl der Zitate die eine Seite von anderen Seiten erhielt als ein Masz fuer die „Relevanz“ einer Seite. In den zweidimensionalen Falschfarbenbildern repraesentierten die Spalten der Abzsisse und auch die Reihen der Ordinate besagte Anzahl an Zitaten.
Ein Beispiel zur Veranschaulichung: man denke sich eine Seite die insgesamt 3 Zitate erhalten hat. Diese Zitate kamen von einer Seiten die selber nur einmal zitiert wurde, einer Seite mit 23 Zitaten und einer Seite mit 23517 Zitaten. Die erste Zahl entscheidet wo man auf der Abzsisse „landet“; in diesem Fall in Spalte #4 (die Zaehlung geht bei Null los, denn es gibt Seiten die keiner zitiert). Nach oben in dieser Spalte geht der Zaehler in den Zellen #2, #24 und #23518 um eins hoch, denn diese Zellen liegen in den Reihen auf der Ordinate die einem, 23 und 23517 Zitaten (welche die Seiten haben die die allererste Seite zitieren) entsprechen.
Wenn man das fuer alle Wikipediaseiten macht, dann baut sich das zweidimensionale Falschfarbenbild der Reihe nach auf. Bei manchen Zellen geht der Zaehler viele Male um eins nach oben (und die wurden damals rot im Falschfarbenbild) und bei anderen (den meisten) gar nicht (die blieben damals blau).
Oder anders: ich schaute damals wie „relevant“ die Seiten waren, die (andere) Seiten mit einem gegebenen „Relevanzwert“ zitiert haben und hier hatte ich das im Detail besprochen.

Nun ist die Anzahl der Zitate aber nur eins (von zwei) Merkmalen die eine Seite kennzeichnen. Das andere ist die Anzahl der Links.
Zur besseren (wenn auch definitiv nicht richtigen) Veranschaulichung, kønnte man sich besagte Anzahl der Links als eine Art „Recherchewert“ vorstellen. Je mehr Links eine Seite hat, um so besser ist diese recherchiert.
Dann kønnte man schauen, wie gut die Seiten recherchiert sind, die (andere) Seiten mit einem gegebenen „Relevanzwert“ zitiert haben. Man wuerde hier also die Anzahl der Links ueber der Anzahl der Zitate auftragen.
Dieses Diagramm ist aber nicht symmetrisch, denn die Relation wie die Daten zustande kommen geht nur in eine Richtung — (die auf der Ordinate abgetragenen Seiten zitieren die auf der Abszisse abgetragenen Seiten). Man kann das „Links-ueber-Zitate“-Falschfarbenbild also nicht „rueckwaerts“ lesen, wenn man wissen will wie „relevant“ die Seiten waren, die (andere) Seiten mit einem gegebenen „Recherchewert“ zitiert haben. Um das zu untersuchen muss man „Zitate-ueber-Links“-Falschfarbenbild erstellen.
Als Letztes kann man dann auch noch schauen, wie gut die Seiten recherchiert sind, die (andere) Seiten mit einem gegebenen „Recherchewert“ zitiert haben. Das entspricht einem „Links-ueber-Links“-Falschfarbenbild.

Oder anders: die „Bedeutung“ der Achse kann sich aendern, je nachdem, was darauf abgetragen ist. Das wiederum ist ein maechtiges Werkzeug, mit dem man viel ueber die Daten herausfinden kann. Damals ist mir das entgangen und ich entdeckte das erst jetzt, beim nochmals drueber nachdenken.

Nun ist das Kevin Bacon Projekt aber eigentlich abgeschlossen und ich habe auch keine Lust mehr, das alles detailliert zu untersuchen. Andererseits møchte ich besagtes Werkzeug genau besprechen.
In den naechsten paar Beitraegen wird Letzteres passieren und dabei werde ich „zweigleisig“ Diagramme und Falschfarbenbilder praesentieren. Um der Reproduzierbarkeit gerecht zu werden, werde ich Falschfarbenbilder vergleichen, bei denen die „Bedeutung“ beider Achsen der Anzahl der Zitate entspricht, die aber zum Einen aus den Daten von 2020 und zum Anderen aus den Daten von 2023 generiert wurden.
Dies wird aber nur einen (relativ kleinen) Teil ausmachen, denn ich møchte auch die Falschfarbenbilder aller anderen Achsenbedeutungskombinationen vorstellen. Auch dabei werde ich den Vergleich anfuehren, allerdings sind solche Bilder ja auch dann neu, selbst wenn sie mit Daten aus dem Jahre 2020 entstanden sind.

Bei all dem (denn das wird schon genug), werde ich nicht (nochmal) alles genau anschauen. Im Wesentlichen habe ich vor, nur besagte Falschfarbenbilder rein zu stellen als Veranschaulichung dessen, was das Werkzeug kann und ich habe vor den Fokus der Diskussion auf Letzteres zu legen.
Andererseits muss ich auch auf ein paar Dinge im „Dunstkreis“ dieses Werkzeugs eingehen. Auch hier habe ich vor 2020-Daten mit 2023-Daten zu vergleichen.

Das soll reichen fuer heute. Und weil’s systematisch vonstatten gehen soll, muss ich beim naechsten Mal zunaechst den „Relevanzwert“ nochmals genauer betrachten (und dabei zum „Bedeutungswert“ verallgemeinern).

Als naechstes hatte ich mir damals die Histogramme bzgl. der Zitate die eine Seite erhaelt und danach bzgl. der Links die eine Seite hat angeschaut. Beim naeheren Anschauen des Histogramms bzgl. der Zitate wurde ich zum ersten Mal bewusst auf  maechtige Gesetze aufmerksam. Hier und heute vergleiche ich in diesen beiden Diagrammen …

… die angesprochenen Histogramme, gebildet mit den alten und mit den neuen Daten (man beachte die unterschiedlichen Abzsissen!). Man sieht, dass sich nix Wesentliches veraendert hat.
Bei den Zitierungen gibt es nur zwei neue Seiten, die mehr als 1 Million Zitate haben. Insb. die zweite Seite davon, mit ueber 5 Millionen Zitaten, spielt gleich nochmal eine Rolle. Bei den Links hat sich die Anzahl der Seiten mit wenigen Links etwas vermindert. Keine dieser Aenderungen wuerde ich jetzt aber derart einschaetzen, dass qualitativ, oder auch quantitativ (innerhalb gegebener Grenzen), andere Schlussfolgerungen aus den Daten zu ziehen sind.

Danach hatte ich mir den kumulativen Anteil der Seiten und Zitate / Links angeschaut (als Diagramm kuriosweise zuerst bzgl. der Links und dann nachgeliefert bzgl. der Zitate). Hier der Vergleich der alten Kurven mit den neuen Kurven diesbezueglich (man beachte wieder die unterschiedlichen Abzsissen):

Wieder kann im Wesentlichen gesagt werden, dass sich nix geaendert hat. Wie auch, denn diese Kurven folgen ja aus den obigen Histogrammen.
Im Detail geschaut scheint bzgl. der Zitate die blaue Kurve fuer grosze Werte auf der Abzsisse etwas „abzusacken“. Das ist schnell geklaert und einzig und allein durch die eine, oben erwaehnte Seite zurueckzufuehren. Diese haeuft naemlich ueber 5 Millionen Zitate nur auf sich selber an und das macht dann den „Knick und Sprung“ ganz am Ende und „schiebt“ den Rest der Kurve nacht unten. Weil’s nur eine einzige Seite ist, hat das keine Auswirkungen auf die rote Kurve und nimmt man diese Seite raus, sind die blauen Kurven beinahe deckungsgleich.
Bzgl. der Links ist die leichte „Verschiebung nach unten“ bei der neuen roten Kurve durch die gerungfuegig geringere anzahl an Seiten mit wenigen Links zu erklaeren.

Das soll reichen fuer heute :) . Ich bin mir noch nicht sicher, ob ich mir die Relevanzbetrachtungen nochmal anschaue, denn diese folgen mittelbar ja auch nur aus obigen Histogrammen. Auszerdem hatte ich da „nur“ bunte 2D-Falschfarbendarstellungen bei denen ich genau „reinzoomen“ musste um Details zu besprechen. Oder anders: bei denen sieht man bei so kleinen Veraenderungen ohnehin keinen Unterschied (und „reingezoomt“ hatte ich nur bei Anomalien die vermutlich immer noch da sind und wenn nicht mir auch nix ueber das Grosze und Ganze verraten). Solche „bunten Karten“ kann ich auch nicht zum besseren Vergleich uebereinander legen. Vermutlich werd ich da also nicht nochmal drueber schauen mit den neuen Daten … allerdings dachte ich zunaechst genau so bzgl. der Simulation von Namen … mhm mhm mhm.

Als ich mich das erste Mal mit der Verteilung der Laenge der Wikipediaartikeltitel beschaeftigte, simulierte ich sehr viele Namen um etwas genauer zu untersuchen und meinte beim letzten Mal bzgl. der Simulation:

Auch wenn ich das Programm dazu gerade nochmal neu schreibe, werde ich das hier nicht wiederholen, denn diese Simulation war von externen Daten abhaengig und wuerde heute genauso ausfallen.

Und damit lag ich zwar nicht komplett daneben … es war aber auch nicht ganz richtig, denn ich kam sehr wohl auf andere Ergebnisse. Dazu weiter unten mehr.

Zunaechst møchte ich aber nochmal darauf eingehen, wieviele Vornamen man braucht um 50 Prozent aller Babies einen Namen zu geben (wenn diese nach der Beliebtheit ihrer Vornamen sortiert werden). Das war selbst mir zu periphaer vor drei Jahren und ich hatte das deswegen in den damaligen Geburtstagsbeitrag ausgelagert (ich meine das zweite Bild). Dabei hatte ich aber nur Daten betrachtet die „ueber alle Babies gehen“ (also eine Art „Summensignal“).
Jetzt beim Neuschreiben der Programme fuegte ich eine Funktion ein, welche mir auch die zwei Teile dieses „Summensignals“ separat ausspuckt. Oder anders: ich habe jetzt auch nach Maechen und Jungs getrennte Ergebnisse und das sieht so aus:

Das „Summensignal“ (graue Punkte) ist das Selbe wie beim vor drei Jahren (auszer, dass drei weitere Jahre dazugekommen sind). Ich fand es aber erstaunlich, dass die Variation bei den Maedchennamen immer ca. 1.5 bis fast 3 Mal grøszer ist (siehe die blauen Punkte). Maedchennamen machen also den Hauptteil am Summensignal aus und deswegen bringe ich das hier doch nochmal, denn das habe ich ja damals ueberhaupt nicht gesehen.
Nun stellt sich natuerlich die Frage warum das so ist, welche ich hier aber nicht beantworten kann (einfach weil ich’s nicht weisz und nicht wuesste wie ich an entsprechende Daten kommen kønnte). Aber zwei potentielle Ursachen fallen mir ein. Zum Einen, kønnten Jungs staerker irgendwelchen Namenstraditionen unterliegen als Maedchen; der Uroppa hiesz schon so und deswegen heiszt der Enkel auch so. Zum Anderen kønnte es aber auch sein, dass es mglw. mehr Maedchennamen als Jungsnamen gibt; der „Maedchennamentopf“ ist also „grøszer“. Das wuerde nicht mal unbedingt mit dem Anstieg ab ca. Mitte der 80er Jahre im Konflikt stehen, denn das Verhaeltniss der Namen bleibt (so ungefaehr) das Gleiche. Besagter Anstieg haengt mglw. mit dem demographische Wandel in den USA zusammen, was zu einem (viel) mehr an Namen fuehrt. Aber dieses „Mehr an Namen“ verteilt sich (mehr oder weniger) gleichmaeszig ueber Jungs- als auch Maedchennamen.

Das war das Ergebnis das sich nicht aenderte. Im gleichen Geburtstagseintrag zeigte ich aber auch die Parameter der Gausskurven fuer jaehrliche Simulationen … und die haben sich geaendert. Hier sieht man das fuer die Position des Zentrums …

… welches im Mittel jetzt sogar noch besser mit dem beim letzten Mal erwaehnten „Hauptprozess“ uebereinstimmt … und hier fuer die Amplitude und Standardabweichung besagter jaehrlichen Gaussfits:

Zum Glueck liegen die Ergebnisse nicht nur in der selben Grøszenordnung, sondern auch innerhalb des selben (sehr engen) Bereichs. Auszerdem sind die allgemeinen Merkmale (wann die Kurven hoch oder runter gehen bzw. so ungefaehr gleich bleiben) im Wesentlichen auch die Gleichen. Ja es gibt Abweichungen (die ja auch der Grund sind, warum ich das hier doch nochmal bringe) aber weil sich das alles ohnehin in sehr engen (Zahlen)Bereichen befindet sind sowieso nur die grøszeren Trends von Interesse und deswegen aendert sich an meinen damaligen Aussagen nix.

Aber es machte mich natuerlich sehr stutzig, dass bei gleichen Ausgangsdaten (zur Erinnerung: fuer diese Simulationen benutzte ich externe Namensdaten und nicht die Wikipedia und an denen hat sich nix geaendert seit 2021) und eigentlich (und auch uneigentlich) gleicher Methode ueberhaupt etwas anderes raus kam.
Es stellte sich heraus, dass der Fehler bei mir lag. Zur Erinnerung: beim zufaelligen „Ziehen“ von Namen aus dem groszen Namenstopf war die Wahrscheinlichkeit einen bestimmten Namen zu ziehen davon abhaengig wie oft der (im jeweiligen Jahr) an Babies vergeben wurde. Fuer 1880 gab es also viele Marys und Johns im Namenstopf, aber nur sehr wenige Wilmas und Zachariahs.
Wie oft ein Name im Topf vorkommt berechnete ich nun so, dass ich die Anzahl der Babies mit einem gewissen Namen durch die Anzahl aller Babies teilte (so weit so gut) und dann mit der Anzahl der Namen die ich insgesamt simulieren wollte multiplizierte (immer noch so weit so gut). Aber weil ich bei meinem selbtgeschriebenen „Namen-aus-dem-Topf-zieh“-Algorithmus nur mit ganzen Zahlen arbeiten konnte, hab ich bei dezimalen Wahrscheinlichkeiten einfach alles nach der ganzen Zahl abgeschnitten. Fuer Namen die im Namenstopf oft genug vorkommen macht das keinen groszen Unterschied. 23517.5 ist nicht viel anders als 23517 … das kann man sogar fuer 10.9 noch argumentieren … mglw. sogar noch fuer 5.5 oder auch fuer 3.9 (selbst hier ist der Fehler ja nicht mal 25 %).

Aber bei all zu kleinen Zahlen kann das Abschneiden der Dezimalstellen im Groszen und Ganzen zu Problemen fuehren, denn es gibt recht viele Namen die bei meinem „selbstgestrickten“ Algorithmus nur ein- oder zweimal im Namenstopf waren und deswegen im Extramfall nur halb so oft gezogen wurden, wie sie haetten gezogen werden sollen.
Beim nochmal Neuschreiben des Programms habe ich das nicht nochmal selbst geschrieben, sondern geschaut was in den vielen umfangreichen Mathebibliotheken von Python zu finden ist und ein entsprechendes Modul benutzt. Besagtes Modul macht alles richtig und deswegen sieht es jetzt anders aus, weil die „Ziehwahrscheinlichkeit“ nun auch fuer sehr selten vorkommende Namen richtig ist.
Zum Glueck ist es aber so, dass sehr selten vorkommende Namen nur sehr selten gezogen werden (selbst wenn mein erster Algorithmus die sogar noch seltener gezogen hat) und deswegen sind die ersten Ergebnisse nicht komplett falsch sondern nur im Detail.

So, das soll jetzt dazu reichen und ich verbleibe wie beim letzten Mal:

[…] wenn ich das richtig sehe, dann gibt’s beim naechsten Mal nicht so viel zu schreiben … aber ich sollte lieber nix versprechen, was ich vermutlich nicht halten kann.

Ganz unabhaengig von der Linknetzwerkanalyse betrachte ich damals die Titellaengen etwas genauer. Hier von Interesse ist nur die Verteilung derselben und daran hat sich wenig geaendert:

Das Integral unter der Kurve ist jetzt etwas grøszer (entsprechend der Anzahl der dazugekommenen Artikel), aber die Form ist so sehr die Gleiche, dass es fast schon das Selbe ist … mhmm … sprachlich gesehen ist „fast das Selbe“ sowas wie „fast schwanger“ … also Quatsch … aber ihr, meine lieben Leserinnen und Leser wisst sicherlich worauf ich hinaus will … aber ich schwoff ab.

Wenn man annimmt, dass alle neuen Artikel sich im Durchschnitt wie alle bereits vorhandenen Artikel „verhalten“ (und das schlieszt die Artikeltitel ein) war das zu erwarten. Und dies ist eine sehr sinnvolle Annahme und jede andere Annahme muss SEHR gut begruendet sein! Natuerlich sind Abweichungen vom Durchschnitt denkbar. „Nichtdurchschnittlich“ ist es bspw., wenn in den drei dazwischen liegenden Jahren nur Artikel ueber chemische Verbindungen mit langen Namen neu hinzugekommen waeren. So eine Anomalie ist an sich natuerlich interessant, aber die Wahrscheinlichkeit dafuer ist gering und deswegen verteilen sich Laengen der neuen Artikeltitel im Wesentlichen so wie die alten.

Damals konnte ich die Form der Verteilung mittels dreier (gaussverteilter) Prozesse anpassen. Fuer den staerksten dieser drei Prozesse versuchte ich die (Haupt)Ursache zu finden und landete letztlich auf Namen von (mehr oder weniger) beruehmten Leuten.
Dafuer simulierte ich vor drei Jahren zunaechst sehr viele Namen und konnte tatsaechlich (innerhalb vernuenftiger Grenzen) das Zentrum und die Amplitude des ersten erwaehnten Prozesses nachempfinden. Auch wenn ich das Programm dazu gerade nochmal neu schreibe, werde ich das hier nicht wiederholen, denn diese Simulation war von externen Daten abhaengig und wuerde heute genauso ausfallen.

Danach kam ich dann drauf mal zu schauen, ob es bei der Wikipedia vielleicht eine Kategorienseite mit links zu Seiten von Leuten gibt. Die gibt es, aber leider verteilen sich die fast 2 Millionen Seiten zu Leuten auf etlichen tausend Kategorien, weil die vielen Menschen alle fuer unterschiedliche Sachen beruehmt sind.
Einen leider nur halben Ausweg war die Kategorieseite aller lebenden Menschen. Halb deswegen, weil sich dort nur ca. 60 Prozent aller Seiten zu Leuten finden lassen. Das restliche Drittel sind schon verstorbene Menschen und die entsprechende Kategorieseite listet leider nicht die Links zu den Seiten sondern wieder nur die (vielen) Kategorieseiten unter die diese Leute fallen (fielen?).
Aber mit den 2/3 konnte ich zumindest eingeschraenkt arbeiten und die Verteilung der Titellaengen von Seiten zu lebenden Menschen hatte das Zentrum auch an der richtigen Stelle (weil aber so viele fehlten war die Amplitude nur halb so grosz wie die des erwaehnten Hauptprozesses).

Als ich die entsprechenden Programme nochmal schrieb, schaute ich wieder ueber viele Kategorieseiten und stolperte letztlich ueber die Kategorien Births per year und Deaths per year. Da sind die Leute zwar auch nicht direkt aufgelistet, aber die Links zu den Unterkategorien der Leute die in den entsprechenden Jahr geboren / gestorben sind ist systematisch und mit systematischen Sachen kann ich arbeiten.
Und siehe da …

… ich konnte die allermeisten Seiten zu Leuten finden (und nicht nur ca. 60 %). Das sind sicherlich immer noch nicht alle Seiten zu Leuten, denn Autoren muessen die in den entsprechenden Kategorien eintragen, aber ich wuerde schaetzen, dass mir weniger als 5 % fehlen.
Und das Gute ist, dass sich nicht nur das Zentrum nicht verschiebt, sondern die Amplitude der neuen Daten 2/3 der Amplitude des besagten staerksten Prozesses erreicht. Damit ist das Ergebnis nahe genug dran, dass das fuer sich selber spricht und ich das so stehen lassen kann und (anders als damals) nicht rumdiskutieren muss, warum ich denke, dass die Daten (trotz merklich kleinerer Amplitude) vermutlich dennoch richtig sind.

Genug fuer heute … wenn ich das richtig sehe, dann gibt’s beim naechsten Mal nicht so viel zu schreiben … aber ich sollte lieber nix versprechen, was ich vermutlich nicht halten kann.

Wie erwaehnt fehlt in diesem Projekt noch eine grosze und wichtige Sache: sind die Ergebnisse reproduzierbar?

Diese Frage konnte natuerlich nicht mit den selben Daten beantwortet werden und deshalb lud ich mir Ende November 2023 die Wikipedia nochmal runter. Der Prozess war wie beim ersten Mal, nur dass drei Jahre mehr Daten drin waren. Deswegen ist die entpackte Datei nun ca. 90 GB grosz (die drei Jahre juengeren Daten sind „nur“ 75 GB grosz).

Alles was ich damals tat um die relevanten Daten aus der riesigen Datei zu popeln und diese fuer die eigentliche Linknetzwerkanalyse vorzubereiten, machte ich nochmal. Die Programme dazu liesz ich im Wesentlichen unveraendert (die sind jetzt nur besser strukturiert und der Code ist besser kommentiert).
Vor drei Jahren konnte ich die urspruenglichen 75 GB letztlich auf eine nur 1.4 GB grosze (Text)Datei reduzieren. Die Zahl gab ich damals nicht an und mit der Wikipedia vom November 2023 erhøhte sich die Grøsze dieser Datei nur auf 1.6 GB

Damals verblieb ich mit 5,798,312 Wikipediaseiten und 165,913,569 Links. Die neuen Daten enthalten 6,269,403 Seiten und 198,870,985 Links.
Das kønnen wir mit der beim letzten Mal vorgestellten Information vergleichen. Am Ende der Untersuchungsperiode kamen bei der Wikipedia ca. 13-tausend neue Seiten pro Monat dazu. Drei Jahre entsprechen 36 Monaten und somit ca. 468-tausend neuen Seiten. An den Zahlen oben sieht man, das es in echt 471,091 neue Seiten waren … das ist fast schon erschreckend, wie genau die relativ grobe Abschaetzung das abbildet.

Damit fuehrte ich vom Konzept die selbe Linknetzwerkanalyse durch. Im entsprechenden Code veraenderte ich an den Analysestellen nichts. Aber zu den technische interessanten Details fuegte ich noch eine (gar nicht mal so) kleine coole Sache hinzu: die Anzahl der an der Berechnung teilnehmenden Kerne ist nun mittels der Angabe nur einer Zahl einstellbar und nicht mehr hartgecoded … cool wa. Auszerdem schrieb ich ein paar kleine Helferprogramme, welche eine (mehr oder weniger … ehrlich gesagt eher in die Richtung mehr als in die Richtung weniger) automatische Analyse erlauben. Und weil die Hardware sich in den letzten drei Jahren auch „verdoppelte“ (ich habe nun 8 anstatt nur vier Cores) waren diese Aenderungen extra cool, denn ohne weiteres Brimborium, konnte die Linknetzwerkanalyse auf noch mehr Cores gleichzeitig laufen und war noch schneller fertig.

Damit ist das was ich vor drei Jahren ueber mehrere Beitraege und Monate abhandelte auch schon fertig. Trotz der wenigen Zeilen hier war’s fuer mich ein ziemlicher Brocken Arbeit, denn ich musste habe den Code der Programme die all diese Aufgaben uebernehmen besser strukturiert, kommentiert und dokumentiert (und zum Teil auch mit ein paar kleinen Funktionalitaeten erweitert; s.o.). Prinzipiell haette ich das nicht machen brauchen, aber fuer mich zaehlt das zum Abschluss eines Projekts dazu … das muss _meinen_ aesthtetischen Beduerfnissen und allgemein _meinen_ Anspruechen genuegen.
Das ist dann auch der Grund, warum diese Teilaufgabe so schleppend voran geht, denn der Analysecode den ich ueber die drei Jahre schrieb ist katastrophal. Ich dachte doch urspruenglich, dass das nur ein paar wenige Wochen dauert. Und deswegen programmierte ich viele kleine Programme die kleine Aufgaben machen und kommentierte das oft nicht gut genug und ’ne Dokumentation hatte ich schon gar nicht. Zum Glueck habe ich die Angewohnheit schon beim coden Kommentare zu schreiben (weil ich (sicher zurecht) befuerchte, dass ich vergesse warum ich bestimmte Sachen so gecoded habe wie ich sie gecoded habe). Das kommt mir jetzt zu Gute, denn ansonsten waere ich komplett verloren in dem Codedurcheinander. Aber das geht viel besser und deswegen møchte ich das auch viel besser haben (s.o.) und beim wieder drueber gucken sehe ich auch, dass viele Programme in allgemeineren Programmen zusammengefasst werden kønnen.

Waehrend also der Code fuer die erste beiden Teile (relevante Daten sammeln und die Linknetzwerkanalyse) beinahe unveraendert blieb, schreibe ich (bin immer noch dabei) fuer die Analyse der Resultate der Linknetzwerkanalyse im Wesentlichen alles komplett neu. Klar, das was die Programme ausspucken ist das Selbe … MUSS das Selbe sein, denn ansonsten habe ich was falsch gemacht (was uebrigens auch nochmal Zeit kostet zu kontrollieren, denn ich muss die neuen Programme mit den Daten von Ende 2020 laufen lassen und dann mit den damaligen Ergebnissen vergleichen) … aber ich bin VIEL mehr zufrieden mit dem Code an sich.

Das soll reichen fuer heute. Beim naechsten Mal gibt’s dann wieder (mindestens) ein Diagramm.

Beim letzten Mal stellte ich eine neue Datenquelle vor, welche die Anzahl der Seitenaufrufe pro Tag fuer jede Wikipediaseite hat. Das ist von Interesse, denn in den Analysen der vorhergehenden Jahre behauptete ich oft, dass i.A. Seiten mit mehr Zitaten populaerer sind. Das ist durchaus eine plausible Behauptung, allein schon weil oefter zitierte Seiten eine grøszere Chance haben angeklickt zu werden, einfach weil die øfter von Nutzern gesehen werden. Der Quelltext enthaelt allerdings keine Information darueber, dass das auch „in Echt“ (also extern und nicht nur via internen Zitaten von einer Seite zur naechsten) gilt.

Die neuen Daten erlauben mir das nun direkt zu testen indem man sich die Aufrufe einer Seite in Abhaengigkeit von der Anzahl der (Wikipedia internen) Zitate (oder Links) anschaut.
Das ist das Prinzip, aber natuerlich ist das nicht ganz so einfach. Zunaechst einmal muss man die beim letzten Mal erwaehnten natuerlichen und unnatuerliche Artefakte in den Daten „rausmitteln“. Das ist einfach, denn dafuer muss nur die durchschnittliche Anzahl an Seitenaufrufen pro Monat berechnet werden (fuer jede Seite). Es ist leicht einzusehen, dass das nix am allgemeinen Prinzip aendert, die Interpretierbarkeit des Diagramms hingegen deutlich erleichtert.

Ich vermutete aber, dass das immer noch nicht ausreicht, denn ich ging davon aus, dass selbst die durchschnittlichen monatlichen Seitenaufrufe massiv streuen. Oder anders: ich erwartete eine dichte Punktwolke ohne viel Struktur, wie schon bei der Abhaengigkeit der Anzahl der Links von der Anzahl der Zitate von „damals“. Die Løsung lag (wieder) in einer gruppenweise Mittelung der durchschnittlichen Seitenaufrufe. „Gruppenweise“ bedeutet hier (wieder), dass alle Seiten die eine gegebene Anzahl an Zitaten / Links haben eine Gruppe ausmachen. Die durchschnittlichen Seitenaufrufe aller Mitglieder der Gruppe wurden dann gemittelt.
Das sagt nicht mehr unbedingt viel ueber einzelne Seiten aus, denn die Information die in der Streuung der Werte liegt geht komplett verloren. Aber individuelle Seiten interessieren mich ohnehin nicht wirklich. Diese Herangehensweise erhøht die Interpretierbarkeit allerdings deutlich, wenn man auf allgemeine Erwartungen (oder Verhalten) bei einer gegebenen Situation (die Anzahl der Zitate / Link) aus ist.

Und hier ist nun endlich das Diagramm:

Voll super wa! Fuer bis zu ca. 1000 Zitate / 500 Links verhaelt sich die Anzahl der durchschnittlichen monatlichen Seitenaufrufe nach einem maechtigen Gesetz. Danach gilt das nicht mehr i.A. denn die Punkte streuen zu sehr. Letzteres liegt daran, weil ich bei sehr vielen Zitaten / Links nicht mehr genuegend Seiten fuer eine gute Statistik habe. Die obige Behauptung ist aber weiterhin i.A. gueltig, denn Seiten mit mehr als ca. 1000 Zitaten / 500 Links halten sich eher im oberen, als im unteren Teil des Diagrams auf (und bei logarithmischer Achse „haut das doppelt rein“ … streng genommen zehnfach, denn es ist ja ’ne logarithmische Achse).

Natuerlich haette ich die blauen Punkte gar nicht einzeichnen muessen, denn wir wissen ja, dass die Anzahl der Links nach einem maechtigen Gesetz von der Anzahl der Zitate abhaengt. Ich wollte das aber zeigen, denn besagte Abhaengigkeit fuehrt zu unterschiedlichen Anstiegen der blauen und roten „Kurve“.

So … viel mehr gibt’s dazu nicht zu sagen. Es ist fein zu sehen, dass die plausible Behauptung tatsaechlich stimmt.

Damit werde ich dann ab dem naechsten Mal die Reproduzierbarkeit der Ergebnisse angehen … nach ueber drei Jahren wird das dann aber zu einem unregelmaeszigeren Publikationsrhytmus fuehren, denn das mache ich zusammen mit dem neu schreiben der Analyseprogramme und das dauert ’ne Weile.

Ich war schon dabei zusammen zu packen, als ich ueber diese Seite (mglw. muss man nach dem klicken auf den Link die Seite nochmal refreshen um das zu sehen, was man sehen sollte) stolperte, auf der man fuer jede Wikipediaseite schauen kann, wie oft die pro Tag angeschaut wurde. Mein erster Gedanke war: das fetzt ja! Mein zweiter Gedanke war: moment Mal, damit kann ich doch direkt schauen, ob meine Annahme, dass Seiten mit mehr (Wikipedia internen) Zitaten populaerer sind, stimmt. Das konnte ich vorher naemlich nicht, weil diese Information nicht Teil des Wikipedia Quelltextes ist.

Das dortige Interface ist zwar fein, wenn man mal mit ein paar wenigen Seiten rumspielen will, aber ich wollte natuerlich die Daten fuer alle Seiten haben. Dies brachte mich (wieder) zu einer Seite, die ich bereits gaaaaanz am Anfang dieses Projekts vorstellte und dort gibt es einen Direktlink zu den Analytics data files. Von dort geht es dann weiter zu „Pageview complete“ … um dort dann mit zwei verschiedenen Rohdatenquellen konfrontiert zu werden: alte Daten und neue Daten.
Um eine etwas kompliziertere Angelegenheit kurz zu machen: es dauerte eine kleine Weile, bis ich da durchgeschaut hatte und die Datenlage ist etwas uneinheitlich und von Artefakten geplagt.

Dies hier ist ein Beispiel fuer ein unnatuerliches Artefakt (und indirekt eine Mthodenaenderung), in dem man die Klickzahlen fuer Cat und Dog fuer Juli und August 2017 sehen kann. Bei den Hunden ist alles knorke; eine im wesentlichen flach verlaufende Kurve mit ein paar Spitzen in denen ca. 2 1/2 mal so viele Leute sich fuer Hunde interessieren. Letzteres erregt mein Misstrauen erstmal nicht, denn ein Faktor von 2.5 passiert schon mal, gerne auch mehrfach. Das lohnt sich meistens nicht weiter zu untersuchen, denn vllt. gab’s da ’n Artikel ueber ’n Hund in ’ner Lokalzeitung irgendwo, oder eine Netflix-Dokumentation und solche Sachen.
Bei den Katzen hingegen sieht man einen massiven Ansteig um 1 1/2 Grøszenordnungen (!) an nur einem einzigen Tag. Es stellte sich heraus, dass Bots regelmaeszig die Wikipedia durchqueren und dann sowas verursachen. Mal mit mehr, mal mit weniger starken (aber immer deutlich herausstechenden) Klickzahlen.
Solche unnatuerlichen Peaks sind also im Wesentlichen bei allen Seiten dabei … … … bis die Wikipedia eine Methode gefunden hat die Bots zu erkennen und seitdem sind die NICHT mehr mit dabei.

Ein Beispiel fuer ein natuerliches (!) Artefakt ist der Film Tenet. Heutzutage liegt der taegliche Zaehler bei ein paar Tausend Klicks. Als der Film rauskam zeigt dieser aber bis zu ca. 50 Mal so viel an. Ist ja ganz natuerlich (insb. fuer diesen Film) und logisch, beschreibt aber nicht das normale Verhalten.

Ein weiteres Beispiel einer Methodenaenderung sind Nutzer von unterschiedlichen Hardwareplattformen. Am Anfang gab’s keine Mobilfunkversion, dann wurde das nicht unterschieden und alles nur in eine Zahl gepackt und in den neuesten Daten haben Nutzer der „mobilen Wikipedia“ ihre eigenen Klickzaehler.

Ich versuchte Artefakte in den Daten zu erkennen und „rauszurechnen“ … aber das ist alles nicht so eindeutig und fuer das was ich damit erreichen will war es mir zu viel Aufwand. Deswegen beschloss ich davon auszugehen, dass die unnatuerlichen Artefakte sich im Mittel gleich ueber alle Seiten verteilen bzw. im Groszen und Ganzen nicht weiter auffallen.
Ersteres ist durchaus eine plausible Annahme, muesste streng genommen aber nachgewiesen werden. Letzteres ergibt sich daraus, dass unnatuerliche Artefakte selten auftreten (eine weitere Annahme, die eigtl. geprueft werden muesste, aber wenn die oft auftreten wuerden, dann waeren die Statistiken prinzipiell unbrauchbar) und sich ueber’s Jahr gesehen im Mittel … øhm … herausmitteln … bzw. im „Fehler verschwinden“. Im Wesentlichen gilt das Gleiche (das Selbe?) auch fuer natuerliche Artefakte.
Probleme gibt es nur bei Seiten die erst seit kurzem existieren, denn da stellen potentielle (natuerliche) Artefakte einen signifikanten Anteil der Daten und hatten noch keine Zeit sich „rauszumitteln“. Andererseits habe ich ca. 6 Millionen Seiten insgesamt und pro Monat gibt’s nur … … … ja wie viele neue Seiten gibt’s denn eigentlich pro Monat?

Zum Glueck kann man das aus diesen Daten extrahieren, wenn man die zwei folgenden (wieder: durchaus plausiblen) Dinge annimmt. Eine neue Seite hat vor dem Tag ihrer „Geburt“ null Klicks. Am Erstverøffentlichungstag wird die Seite mindestens ein Mal angeklickt; naemlich vom Schøpfer selbst. Ersteres muss man nicht mal nachpruefen, denn das geht nicht anders. Bei Letzterem bin ich mir unsicher, es fuehlt sich aber richtig an; die Wikipedia ist ja nicht mein Weblog, bei dem Artikel im Voraus geschrieben um dann am Tag der Verøffentlichung nicht gelesen zu werden. Falls nicht, dann kønnte man argumentieren, dass ’ne Seite eben erst dann „wirklich geboren“ wird, wenn der erste Leser drauf klickt.
Und hier sieht man die Anzahl der neuen Seiten pro Monat seit Beginn der verfuegbaren Daten (minus ein Monat, denn als Ende 2007 die allerersten Klickzahlen registriert wurden, gab es bereits ca. 3.5 Millionen Seiten):

Die groszen Abszissenstriche kennzeichnen den Januar eines Jahres und die kleinen Abzsissenstriche liegen genau in der Mitte (also zwischen Juni und Juli). Die Jahreszahl ist auf die Mitte eines Jahres zentriert. Auszerdem habe ich natuerlich NUR die Seiten betrachtet, welche in die Kevin Bacon Analysen der letzten Jahre eingeflossen sind.

Was man im Diagramm sieht ist, dass die Anzahl neuer Seiten pro Monat _drastisch_ abgenommen hat. Die Gerade habe ich nur zum Vergleich reingelegt und bei logarithmischer Ordinate entspraeche die einem exponentiellen Abstieg … und wenn man genau hinschaut, ist das tatsaechliche Gefaelle schneller! An dem laengerfristigen Trend konnten auch die Schreibspurts (die pløtzlich auftretenden Spitzen) nur relativ kurzfristig was aendern. Bis Mitte ca. 2015 setzte sich der Trend fort und stabilisierte sich dann auf ca. zehntausend neue Seiten pro Monat, mit _ganz_ leicht steigender Tendenz (ca. 13k pro Monat Ende 2020).

Mit Blick auf Artefakte in neuen Seiten ist im Wesentlichen nur das letzte Jahr relevant. Wir reden hier also von nicht mehr als ca. 150-tausend Seiten oder ungefaehr 2.5 Prozent der ca. 6 Millionen Seiten die in meine Betrachtungen eingflossen sind. Jut … muss ich mir also keine Sorgen deswegen machen.

Das soll reichen fuer heute. Beim naechsten Mal zeig ich dann das, was ich eigtl. zeigen wollte.