{"id":14958,"date":"2026-10-11T13:37:47","date_gmt":"2026-10-11T11:37:47","guid":{"rendered":"http:\/\/www.soeren-in-norwegen.net\/blog\/?p=14958"},"modified":"2026-06-09T00:38:47","modified_gmt":"2026-06-08T22:38:47","slug":"kevin-bacon-graf-zahl-nochmal","status":"publish","type":"post","link":"http:\/\/www.soeren-in-norwegen.net\/blog\/2026\/10\/kevin-bacon-graf-zahl-nochmal\/","title":{"rendered":"Kevin Bacon &#8211; Graf Zahl nochmal"},"content":{"rendered":"<p>2021-04-23 ist das Datum des <a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/2021\/04\/kevin-bacon-i-vorwort\/\" target=\"_blank\" rel=\"noopener\">allerersten Beitrags<\/a> in dieser Kevin-Bacon-Megamaxiserie. Das Projekt begann aber Monate vorher, denn ich musste ja erstmal darueber nachdenken wie ich die ben\u00f8tigten Daten aus der Wikipedia herauskitzeln kann. Leider habe ich den Tag des wirklich wahren Anfangs nicht aufgeschrieben; aber 2021-01-08 ist das Datum an dem die Datei mit der dekomprimierten Wikipedia auf meiner Festplatte zum ersten Mal erstellt wurde.<\/p>\n<p>Dem ersten Artikel folgten in der originalen Analyse, mit allen Ablenkungen und Kommentaren und so, 131 weitere Artikel. In der Reproduktionsphase schrieb ich (inklusive diesem hier) ganz genau 50 weitere Beitraege. Zwei abschlieszende (geheime) stehen noch aus \u2026 wobei ich mit genauen Zahle diesbezueglich vllt. nicht so voreilig sein sollte. Kevin hat schlieszlich immer wieder gezeigt, dass&#8217;s unerwartet mehr wird.<\/p>\n<p>Ich konnte dem inneren Drang alle W\u00f8rter zu zaehlen nicht widerstehen. Die nachfolgenden Zahlen sind nicht alle exakt aber zumindest vernuenftig gerundet. Dennoch sind sie vermutlich etwas zu genau ist, denn ich habe nur &#8217;ne grobe Analyse vorgenommen. Vereinfachend gesagt habe ich alle Texte an den Leerzeichen getrennt und dann nur die Anzahl der einzelnen Elemente hergenommen.<br \/>\nDas wiederum bedeutet, das Bindestrichkonstrukte wie &#8222;das-ist-ein-Beispiel&#8220; nur als ein Wort zaehlen. Andererseits zaehlt ein &#8220; :) &#8220; auch als ein Wort; ebenso der slash in &#8222;foo \/ bar&#8220;. Und Zitate zaehlen die enthaltenden W\u00f8rter nocheinmal. Mein Bauchgefuehl sagt mir aber, dass&#8217;s insgesamt schon passen sollte. Nu aber Butter bei die Fische.<\/p>\n<p>Alle Zahlen beinhalten auch den vorliegenden Beitrag. Insgesamt brachte ich ungefaehr 168-tausend W\u00f8rter in diesen Artikeln zu &#8222;Papier&#8220;. Das entspricht zwei Erstlingsromanen (die im Durchschnitt ca. 75-tausend W\u00f8rter lang sind).<br \/>\nIm Mittel hat ein Artikel 915 W\u00f8rter und mit einem Wert von 891 W\u00f8rtern hat der Median im Wesentlichen den gleichen Wert. Die Standardabweichung betraegt 421 W\u00f8rter.<br \/>\nDer Geburtstagsbeitrag vom letzten Mal ist der <a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/?p=14944\" target=\"_blank\" rel=\"noopener\">H\u00f8henrekord<\/a> mit 2,387 W\u00f8rtern, waehrend ich beim <a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/2021\/08\/kevin-bacon-viii-titelspielereien-b-meiner-ist-am\/\" target=\"_blank\" rel=\"noopener\">Tiefenrekord<\/a> nur 159 W\u00f8rter schrieb (dieser wurde fruehzeitig gesetzt). Zu jeder Zeit kamen immer mal wieder andere Artikel (fast) an diese Zahlen ran \u2026 ich habe das (natuerlich) mal diagrammisiert:<\/p>\n<p><a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article.png\" target=\"_blank\" rel=\"noopener\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter wp-image-14964 size-large\" src=\"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article-1024x412.png\" alt=\"\" width=\"1024\" height=\"412\" srcset=\"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article-1024x412.png 1024w, http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article-800x322.png 800w, http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article-768x309.png 768w, http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/275_words_per_article.png 1140w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/a><\/p>\n<p>Im linken Bild sieht man fuer jeden Artikel die Anzahl der W\u00f8rter; farblich kodiert habe ich die zwei Teile des Projekts. Die (Daten)Punkte scheinen sich ziemlich gleichmaeszig zu verteilen auf den ersten Blick. Das wuerde passen mit den recht aehnlichen Werten fuer Durchschnitt und Median. Auf den zweiten Blick hingegen, nachdem man geistig einen Balken um den oben erwaehnten Mittelwert reinlegt, scheint&#8217;s dann aber ein paar mehr Punkte unterhalb des Mittelwerts als oberhalb davon zu geben. Deswegen gibt&#8217;s das Histogramm dazu auf der rechten Seite.<br \/>\nDie Intervallbreite betraegt 100 W\u00f8rter und der &#8222;dicke Klotz&#8220; links des 900 W\u00f8rter-Balkens macht den Eindruck, dass dort mehr liegt. Von der Anzahl der Artikel ist das tatsaechlich so. Und wuerde man nur 7 Intervalle um den Mittelwert zulassen, dann wuerde das gleiche bzgl. der Wortzahl gelten. Aber die zw\u00f8lf besonders wortreichen Artikel mit mehr als 1600 W\u00f8rtern vereinen ueber 23-tausend W\u00f8rter auf sich und das zieht den &#8222;Schwerpunkt&#8220; der Wortzahl zu etwas h\u00f8heren Werten \u2026 so funktioniert der Mittelwert halt und <a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/?p=14913\" target=\"_blank\" rel=\"noopener\">ich erwaehnte<\/a> den Nachteil des darin liegenden Informationsverlust neulich.<\/p>\n<p>Ich schaute mir auch mal die Worthaeufigkeiten an, da kam aber (fast) nix bei rum. Die ueblichen Verdaechtigen sind wie immer ganz oben dabei; also Worte wie &#8222;die&#8220; (ca. 5,700 mal), &#8222;der&#8220; (ca. 4,500 mal), &#8222;das&#8220; (ca. 4.000 mal), &#8222;und&#8220; (ca. 3,600 mal), &#8222;ist&#8220; (ca. 2,500 mal), &#8222;nicht&#8220; (ca. 1,900 mal), &#8222;aber&#8220; (ca. 1,900 mal), &#8222;dass&#8220; (ca. 1,700 mal) etc. pp.<br \/>\nDas erste interessante das auftritt ist dann auch gar kein Wort sondern das Sonderzeichen &#8220; \u2026 &#8220; , welches (inklusive diesem hier) 1,544 mal auftritt. Von weiterem Interesse war das Wort &#8222;Seite&#8220; (auch im Zusammenhang wie &#8222;Kettenseite&#8220; oder natuerlich &#8222;Wikipediaseiten&#8220;) und das tritt mehr als 1700 mal auf. Das Wort &#8222;Links&#8220; tritt ca. 1000 mal auf. Im Gegensatz dazu erscheinen &#8222;Zitate&#8220; (schon zusammen mit den &#8222;Zitierungen&#8220; gezaehlt) nur knapp 350 mal. Und als allerletztes sei noch &#8222;Linklevel&#8220; erwaehnt, welches ungefaeher 600 mal auftritt.<\/p>\n<p>Apropos Linklevel, ich habe hier mal aufgetragen, wie oft die Abkuerzungen LL<sub>i<\/sub> in Abhaengigkeit von &#8220; i &#8220; zu sehen sind:<\/p>\n<p><a href=\"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/276_linklevels_mentioned_.png\" target=\"_blank\" rel=\"noopener\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter wp-image-14965 size-full\" src=\"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-content\/uploads\/276_linklevels_mentioned_.png\" alt=\"\" width=\"553\" height=\"446\" \/><\/a><\/p>\n<p>Das ist alles erklaerbar. LL<sub>0<\/sub> &amp; LL<sub>1<\/sub> sind reichlich zu Erklaerungen herangezogen worden. Bis ungefaehr LL<sub>10<\/sub> passiert ziemlich viel und ich habe das oft im Detail untersucht. LL<sub>23<\/sub> tritt so haeufig auf, weil ich das gerne als &#8222;zufaelliges&#8220; Linklevel nehme (dito fuer LL<sub>5<\/sub>) und LL<sub>25<\/sub> habe ich nicht selten als Grenze fuer &#8222;hier-ist-jetzt-definitiv-ein-anderes-Verhalten-als-vorher&#8220; genommen. Wenn ich mich richtig erinnere ist LL<sub>66<\/sub> das Linkevel an dem die ersten Seiten anfangen &#8222;auszusteigen&#8220;; entsprechend oft wird das genannt worden sein.<br \/>\nKurios ist die Kluft zwischen LL<sub>50<\/sub> &amp; LL<sub>59<\/sub> \u2026 aber da passiert halt nuescht \u2026 andererseits passiert auch nuescht zwischen LL<sub>25<\/sub> und LL<sub>50<\/sub> aber dort habe ich trotzdem Datenpunkte \u2026 mhmmmmm.<br \/>\nDer einzige Punkt den ich nicht auf Anhieb erklaeren kann, ist LL<sub>22<\/sub>. Andererseits tritt das (inklusive diesem hier) dann doch nur 14 mal auf und das ist jetzt in 2 ganzen Romanen die Zeuch auf Linkleveln beschreiben wo irgendwie doch was in dem Bereich passiert (siehe die Bemerkung zu LL<sub>25<\/sub>) dann mglw. doch nicht soooo haeufig.<\/p>\n<p>Soweit dazu \u2026 das waren aber nur die W\u00f8rter in den Artikeln. Dazu kommt noch der Code \u2026 das ist aber etwas komplizierter. Am einfachsten ist noch die generelle (zugegeben, oft sehr spezifische) Dokumentation der Programme an sich. Da schrieb ich ca. 48-tausend W\u00f8rter \u2026 ach du Schreck.<br \/>\nDer Code wird weiter unterteilt in Python und C. Und da gebe ich natuerlich auch die Anzahl der Linien an \u2026 weil \u2026 das macht man halt so.<\/p>\n<p>Insgesamt sind&#8217;s 21,073 Linien von denen 19,081 auf Python und 1,992 auf C entfallen. Davon sind aber insgesamt 9,643 Linien Kommentare (Python: 8,673 \/ C: 970); das entspricht ca. 45 %. Weitere ungefaher 25 % sind leere Zeilen, damit der Code leichter zu lesen und dessen Struktur besser zu erkennen ist und ueberhaupt, dass es nicht wie Querbeet aussieht; das entspricht 5,426 Linien (Python: 4,968 \/ C: 458).<br \/>\nDer Rest sind der eigentliche Code und ich komme da insgesamt auf genau 6,004 Linien (Python: 5,440 \/ C: 564).<\/p>\n<p>Insbesondere auf die nur 564 C-Zeilen bin ich recht stolz. Ich denke, dass das Programm an und fuer sich relativ komplex ist, insb. mit dem was &#8222;unter der Haube&#8220; passiert (Zeuch auf das ich an dieser Stelle nie im Detail eingegangen bin) \u2026 und ich hab&#8217;s trotzdem so klein halten k\u00f8nnen.<br \/>\nUeberhaupt zeigt das recht eindrucksvoll, wieviel man aus derart schlanken Programmen herausholen kann, wenn die relativ spezifischen Aufgaben gewidmet sind.<\/p>\n<p>Und nun zur Anzahl der W\u00f8rter in den Kommentaren und dem Code an sich. Die Kommentare sind einfach, denn das ist &#8222;plain old english&#8220; und im Wesentlichen gelten die gleichen Limitierungen wie zu den Artikeln.<br \/>\nIch komme insgesamt auf ca. 65-tausend (Python) + ca. 7,500 (C) = ca. 72,500 W\u00f8rter insgesamt in den Kommentaren \u2026 ach du Schreck. In nicht unbetraechtlichen Teilen ist das nochmal Zeuch was schon in der Dokumentation steht (weil&#8217;s zum Verstaendniss der Strukturen und Details im Code beitraegt \u2026 hoffe ich). Es beinhaltet aber natuerlich auch sehr viel &#8222;operativen Kram&#8220; (wie die Erklaerung warum man in einer Liste das erste Element weglaeszt oder warum eine Schleife nicht ganz bis zum Ende zaehlt etc. pp.) und einfach nur &#8222;beschreibenden Text&#8220;, der das Lesen und verstehen erleichtern soll.<\/p>\n<p>Beim Code an sich ist das etwas uneindeutiger. Denn viele Zeichen wie &#8220; &lt;= &#8220; oder &#8220; { &#8220; werden als Wort gezaehlt bei meiner einfachen Zaehlweise. Und natuerlich gibt&#8217;s urst viele &#8222;if&#8220;, &#8222;then&#8220;, &#8222;continue&#8220;, &#8222;for&#8220; etc. pp. und auch einen guten Anteil Zaehlvariablen (meistens einfach nur ein &#8220; i &#8222;). Dann wiederum wird sowas wie <code>line.strip().split('\\t')[1:]<\/code> nur als ein einziges &#8222;Wort&#8220; gezaehlt. Wieauchimmer, ich komme auf ca. 22-tausend (Python) + ca. 1,500 (C) = ca. 23,500 W\u00f8rter (oder &#8222;W\u00f8rter&#8220;) insgesamt, die sich nur im Code befinden. Das selbe was ich oben zu den Linien im C-Code sagte k\u00f8nnte ich hier wiederholen \u2026 ich denke, dass ich da zu Recht durchaus stolz auf mich sein kann.<\/p>\n<p><em>Summa summarum<\/em> betraegt die Anzahl der W\u00f8rter im Code und in der Dokumentation ungefaehr 145-tausend. Also zwei weitere Buecher \u2026 krass \u2026 insb. wenn man bedenkt, dass das was am meisten Spasz macht (der Code an sich, ohne Kommentare oder Dokumentation) davon nur ca. 15 % ausmacht \u2026 und der Teil der am meisten Freude brachte (besagter C code) sogar gerade mal nur ein Prozent.<\/p>\n<p>So \u2026 nun wird das noch mit den W\u00f8rtern in den Weblogartikeln zusammengezaehlt und ich komme auf insgesamt ungefaehr 310-tausend W\u00f8rter \u2026 krassomat!<\/p>\n<p>Das war&#8217;s aber noch nicht \u2026 ein bisschen habe ich noch. Das geht aber schnell, denn es handelt sich dabei um die Anzahl der Bilder. Ich erstellte ueber eintausendzweihundert Bilder und Diagramme \u2026 wow! Gezeigt habe ich aber weniger als 500, denn ein nicht unbetrechtlicher Teil ist (mehr oder weniger) versteckt in den &#8222;bewegten&#8220; Bilder (aber jeder &#8222;Frame&#8220; musste ja einzeln erstellt werden).<\/p>\n<p>Und das war er dann jetzt wirklich \u2026 der letzte ordentliche Artikel und die letzten Diagramme im groszen Kevin Bacon Projekt, was mich und euch, meinen lieben Leserinnen und Leser, fast 5 1\/2 Jahre lange begleitete.<\/p>\n<p>Viel wurde gesehen, viel wurde ausprobiert, viel wurde verstanden, viel wurde geschrieben (s.o.) und oft genug hatte ich keine Lust mehr. Aber ich habe es vollendet und nun ist&#8217;s offiziell dann doch vorbei \u2026 ich gebe ehrlich zu: endlich. Ich muss auch zugeben, dass&#8217;s sich noch nicht &#8222;ganz echt&#8220; anfuehlt; ein mir nicht unbekannter &#8222;Zustand&#8220;, kenne ich das doch vom Diplom und den zwei Doktorgraden. Grosze Projekte haben das vermutlich so an sich.<\/p>\n<p>Ganz im Geiste des Kevin Bacon Projektes kommt natuerlich doch noch was. Naemlich die zwei erwaehnten (immer noch) geheimen Artikel. Die sind aber nix &#8222;handfestes&#8220; mehr, dort wird nix analysiert, modelliert, simuliert oder kommentiert und Diagramme gibt&#8217;s darin auch nicht.<\/p>\n<p>Aber weil das der letzte &#8222;richtige&#8220; Artikel ist, m\u00f8chte ich sagen: toll war&#8217;s! Ich habe so viel gelernt und ich bin froh, dass ich damals Ende 2020 die Idee hatte mir das mal anzuschauen \u2026 auch wenn ich dachte, dass ich das ganze in ca. 6 Artikeln abarbeiten kann \u2026 tja \u2026 so kann man sich taeuschen \u2026 aber die &#8222;Taeuschung&#8220; war gut, denn ich (als S\u00f8ren) fuehle mich durch das Kevin Bacon Projekt tatsaechlich bereichert.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>2021-04-23 ist das Datum des allerersten Beitrags in dieser Kevin-Bacon-Megamaxiserie. Das Projekt begann aber Monate vorher, denn ich musste ja erstmal darueber nachdenken wie ich die ben\u00f8tigten Daten aus der Wikipedia herauskitzeln kann. Leider habe ich den Tag des wirklich wahren Anfangs nicht aufgeschrieben; aber 2021-01-08 ist das Datum an dem die Datei mit der [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-14958","post","type-post","status-publish","format-standard","hentry","category-allgemein"],"_links":{"self":[{"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/posts\/14958","targetHints":{"allow":["GET"]}}],"collection":[{"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/comments?post=14958"}],"version-history":[{"count":6,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/posts\/14958\/revisions"}],"predecessor-version":[{"id":14967,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/posts\/14958\/revisions\/14967"}],"wp:attachment":[{"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/media?parent=14958"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/categories?post=14958"},{"taxonomy":"post_tag","embeddable":true,"href":"http:\/\/www.soeren-in-norwegen.net\/blog\/wp-json\/wp\/v2\/tags?post=14958"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}