Mein Schreibtisch ist aufgeräumt. Links das Notizbuch, in der Mitte der Bildschirm, daneben eine Tasse. In Notion ist die Tagesnotiz offen, drei Aufgaben stehen für heute an, die Notizen von gestern sind verlinkt.
Das ist keine Kulisse. Das ist mein Arbeitsplatz — und er funktioniert.
Und trotzdem sitze ich seit zwei Jahren vor derselben ungelösten Frage: Wo genau gehört die KI in dieses Bild?
Was Wissensarbeit für mich heisst
Wissensarbeit ist für mich kein abstrakter Begriff. Sie hat zwei Seiten, die zusammengehören.
Die eine Seite ist die Arbeit am Computer: Notizen, Recherche, Konzepte, Kursunterlagen, Mails. Die andere Seite ist der Schreibtisch selbst — Licht, Ordnung, Papier, Gerät, Griffweite. Ich nenne das Digital Workplace Design: die bewusste Gestaltung der eigenen Lern- und Arbeitsumgebung, digital und physisch.
Warum das zusammengehört? Weil beides dieselbe Frage beantwortet: Wie viel Reibung entsteht zwischen einem Gedanken und dem Ort, an dem er landet? Ein unaufgeräumter Schreibtisch kostet mich Aufmerksamkeit. Ein unaufgeräumtes System kostet mich dasselbe — nur unsichtbar.
Deshalb frage ich bei jedem Werkzeug zuerst: Passt es in diese Umgebung? Oder verlangt es, dass ich meine Umgebung um das Werkzeug herum umbaue?
Wo ich heute stehe: Das System trägt
Nach bald sieben Jahren Praxis kann ich das ziemlich nüchtern sagen: Meine Wissensarbeit funktioniert. Vier Dinge laufen verlässlich.
- Erfassen — Jeder Gedanke hat einen Ort. Inbox für Aufgaben, Notiz für Ideen, keine mentalen Merkzettel.
- Strukturieren — PARA gibt allem eine handlungsorientierte Ordnung: Projekte, Arbeitsbereiche, Ressourcen, Archiv.
- Dokumentieren — Was ich erarbeite, bleibt auffindbar. Nicht als Archivleiche, sondern verlinkt.
- Reflektieren — Tagesjournal, Wochenrückblick, Quartals-Review. Der Teil, der aus getaner Arbeit ein Verstehen der eigenen Arbeit macht.
Das ist im Kern die Struktur, die ich in meiner Roadmap zum Second Brain beschreibe — und die ich selbst in Notion als mindOS umgesetzt habe: ein Aufgabensystem, ein Denkraum, eine Ordnungsstruktur.
Dieser Punkt ist mir wichtig, weil er den Ausgangspunkt verschiebt. Ich suche kein System mehr. Ich habe eines. Die offene Frage ist eine andere.
Die offene Stelle: bewusst verknüpfen, aber nicht assoziativ
So arbeite ich heute mit einem LLM: Ich nehme einen einzelnen Aspekt aus meiner Wissensarbeit — ein Projekt, eine Notizsammlung, ein Transkript — und gebe ihn gezielt in den Chat. Bewusst ausgewählt, bewusst begrenzt.
Das hat zwei gute Gründe. Erstens Datenschutz: Was ich nicht übergebe, verlässt mein Gerät und mein System nicht. Zweitens Präzision: Ein enger Kontext liefert bessere Antworten als ein überladener.
Aber es hat einen Preis, und der stört mich zunehmend. Diese Arbeitsweise bildet kein assoziatives Arbeiten ab.
Mein Second Brain lebt genau davon. Die wertvollsten Momente sind die, in denen eine alte Notiz zu einer neuen Frage auftaucht — eine Verbindung, die ich nicht geplant habe. Zettelkasten nennt das emergente Struktur. Wenn ich dem Modell aber nur den Ordner reiche, an den ich gerade denke, kann es genau diese Verbindung nicht finden. Es sieht nur, woran ich ohnehin schon denke.
Der spannende nächste Schritt wäre also beides gleichzeitig: bewusste Verknüpfung für den Fokus — und assoziativer Zugriff auf den ganzen Bestand für die Überraschung.
Ein Wort zum Begriff, weil er den Rest des Textes trägt: Mit assoziativ meine ich nicht einfach einen grösseren Suchraum. Ich meine ein anderes Auswahlkriterium. Suche optimiert auf Ähnlichkeit zur Frage; assoziativer Zugriff sucht zusätzlich nach Notizen, die denselben Begriff anders verwenden. Damit lautet die Frage nicht, wie viel die KI sehen darf, sondern nach welchen Regeln sie darin sucht — und die begleitet alles, was jetzt kommt.
Die Hypothese: Verflacht das die Antworten?
Hier wird es interessant, und hier bin ich unsicher.
Ein LLM antwortet mit Wahrscheinlichkeiten. Es wählt nicht das Treffendste, sondern das Naheliegendste. Meine Hypothese: Wenn ein Modell assoziativ über mein gesamtes Material streift, wirken zwei Kräfte gegeneinander.
Kraft eins — Präzisierung. Es findet echte Bezüge in meinem Material, die ich vergessen hatte. Die Antworten werden spezifischer, weil sie auf meinem Erfahrungswissen stehen statt auf Internetdurchschnitt.
Kraft zwei — Verflachung. Es glättet. Es wählt aus meinem Material das Typische, nicht das Eigenwillige — und liefert mir mein eigenes Denken als Mittelwert zurück.
Für die zweite Kraft gibt es Evidenz, für die erste bisher keine. Das ist kein Gleichstand, aber auch kein Urteil über meinen Fall: Die Studien messen Schreiben und Ideenfindung mit einem Modell, nicht Suche über einen persönlich kuratierten Bestand. Was sie zeigen, ist, dass Homogenisierung ein messbarer Effekt ist und keine Kulturkritik. Was sie nicht zeigen, ist, wie er sich verhält, wenn das Material vom Nutzenden stammt. Drei Befundlinien:
- Die Outputs werden ähnlicher. KI hebt die individuelle Qualität und senkt zugleich die kollektive Vielfalt [1][2][3]. Eine Meta-Analyse über 19 Studien und 61 Effektstärken findet einen kleinen, aber robusten Homogenisierungseffekt [4]. Sprache und Perspektiven verengen sich messbar [5][6].
- Der Wissensbestand selbst verengt sich. Die epistemische Vielfalt in Modellantworten liegt unter der klassischer Wissensquellen [7]. Und Modelle, die auf eigenen Ausgaben weitertrainieren, verlieren die Ränder ihrer Verteilung — Model Collapse [8]. Das ist kein Befund über Retrieval, sondern eine Analogie: Training auf eigenen Ausgaben ist etwas anderes als Suche im eigenen Bestand. Sie zeigt nur, wie schnell ein System die Ränder verliert, wenn es sich vom eigenen Material ernährt.
- Wir selbst verflachen mit. Wer Texte mit einem LLM schreibt, erinnert weniger und beansprucht das Ergebnis weniger als eigenes [9]. Wissensarbeitende berichten selbst von weniger kritischem Aufwand [10], und intensive Nutzung korreliert mit schwächerem kritischem Denken [11].
Ehrlichkeitshalber: Mehrere dieser Arbeiten sind Preprints, einige haben kleine Stichproben, und keine untersucht meinen Spezialfall — ein Modell mit assoziativem Zugriff auf ein persönlich kuratiertes System. Es gibt auch Gegenevidenz: Der Effekt lässt sich abschwächen, wenn man bewusst mit unterschiedlichen KI-Perspektiven arbeitet [12].
Zwei Hypothesen, die sich widersprechen
Wenn ich diese Befunde auf meinen Fall übertrage, stehen sich zwei Erklärungen gegenüber. Sie klingen wie Alternativen, sind aber keine – sie messen gegen verschiedene Referenzen. Hypothese A fragt, ob ich mich meinem eigenen Durchschnitt annähere. Hypothese B fragt, ob ich mich vom Trainingsdurchschnitt entferne. Der unangenehme Fall ist der, in dem beides zutrifft: Antworten, die gegenüber dem Internet eigenwillig wirken und gegenüber meinem Denken nichts Neues enthalten.
Hypothese A — Personalisierung verstärkt den Tunnel. Je besser ein Modell meine Begriffe, meine Links und meine Kategorien kennt, desto zuverlässiger reproduziert es sie. Es lernt meine Sprache und meine Vorannahmen. Was ich dann für Präzision halte, ist Wiedererkennung. Der Homogenisierungseffekt verschwindet nicht, er wird privat: Statt zum Durchschnitt aller Nutzenden konvergiere ich zu meinem eigenen Durchschnitt. Das wäre die teuerste Form der Verflachung, weil sie sich wie Verstehen anfühlt. Es ist die Narzissmusfalle, über die ich schon einmal geschrieben habe — nur mit besserem Material. Das Modell spiegelt dann nicht mehr das Internet. Es spiegelt mich.
Hypothese B — Personalisierung bricht den Modellmittelwert. Mein Bestand ist keine glatte Fläche. Da liegen Notizen aus Philosophie und Biologie neben Schulleitungsprotokollen, Notion-Systembau und Kursunterlagen. Dazu Widersprüche aus sieben Jahren, verworfene Positionen, halbfertige Gedanken. Genau dieses Material fehlt im statistischen Standardraum eines Modells. Ein heterogener persönlicher Kontext wirkt dann als Gegen-Prior: Er zieht die Antwort aus der Mitte der Trainingsverteilung heraus, weil er anbietet, was dort nicht vorkommt.
Der Begriff kommt aus der Statistik. Ein Prior ist die Vorannahme, die ein System mitbringt, bevor es neue Information sieht. Bei einem LLM ist der Prior die Trainingsverteilung: Was in Millionen Texten häufig zusammen vorkommt, gilt als wahrscheinlich — und genau das wird ausgegeben.
Ein Gegen-Prior ist Information, die diese Vorannahme verschiebt. Sie macht etwas wahrscheinlich, das im Trainingsdurchschnitt selten vorkommt. Der Begriff sagt damit auch, wogegen mein Material arbeitet: gegen die eingebaute Erwartung des Modells.
Wenn Hypothese B trägt, kehrt sich meine Ausgangsfrage um. Mein persönlicher Kontext wäre nicht das Risiko der Verflachung, sondern ein Teil ihrer Lösung.
Das ist eine Vermutung, keine Erkenntnis. Die zwölf Quellen oben stützen Hypothese A. Für Hypothese B habe ich bisher ein Argument und keine Daten. Also teste ich sie: acht Wochen, ein fester Aufgabentyp, jede Aufgabe einmal mit engem und einmal mit breitem Zugriff auf meine Notizen. Die Antwortpaare notiere ich ohne Kennzeichnung und bewerte sie erst am Wochenende – sonst bewerte ich meine Erwartung mit. Zwei Kriterien, weil Neuheit allein nichts beweist: erstens der Anteil Antworten, aus denen etwas ins System zurückfliesst; zweitens der Anteil Antworten, die meine Ausgangsposition nur bestätigen. Hypothese B trägt nur, wenn der breite Zugriff beim ersten Wert deutlich vorne liegt und beim zweiten nicht schlechter ist. Die Schwelle setze ich vorher: mindestens ein Drittel Unterschied, sonst bleibt es beim engen Zugriff.
Die Bedingung ist allerdings streng: Es reicht nicht, dass das Material heterogen ist. Auch der Zugriff darauf muss heterogen sein. Ein Retrieval, das aus einem vielstimmigen Bestand immer die drei passendsten Notizen zieht, stellt die Homogenität eine Ebene höher wieder her.
Damit ist die eigentliche Frage nicht mehr, wie viel von meinem System ich einem Modell zeige. Die Frage ist, nach welchen Regeln es darin suchen darf.
Werkzeug, nicht Gegenüber
Eine Präzisierung, die den ganzen Rest trägt.
Ein LLM ist für mich kein denkendes Gegenüber. Es ist ein Werkzeug, um Relationen in Sprache und zwischen sprachlich gefassten Zusammenhängen sichtbar zu machen, zu variieren und neu anzuordnen.
Das kann viel sein. Es zeigt Muster, schlägt entfernte Bezüge vor, stellt Dinge nebeneinander, die ich nie nebeneinander gelegt hätte. Es erweitert meinen Wahrnehmungsraum.
Aber eine Relation ist noch keine Bedeutung. Ein Modell berechnet Zusammenhänge und formuliert sie plausibel. Daraus folgt nicht, dass der Zusammenhang für meine Arbeit etwas bedeutet. Bedeutung entsteht erst, wenn ich die Verbindung wahrnehme, prüfe, in meinen Erfahrungskontext einordne und ein Urteil fälle.
Das ist kein philosophisches Ornament, sondern eine Arbeitsanweisung: Sie legt fest, welchen Schritt ich nicht delegiere.
Damit verschiebt sich auch die Frage aus dem vorherigen Abschnitt. Ob eine Antwort flach bleibt, entscheidet sich nicht nur am Zugriff, sondern an diesem Schritt. Wo ich das Urteil abgebe, bekomme ich Verflachung auch dann, wenn die Suchregeln gut gebaut sind. Das Zugriffsdesign kann mir bessere Vorlagen liefern. Das Prüfen nimmt es mir nicht ab.
Dazu kommt die praktische Bedingung. Je mehr Material im Spiel ist, desto wichtiger wird, wo es verarbeitet wird. Je näher die Verarbeitung ans eigene Gerät rückt, desto weniger muss ich zwischen Vollzugriff und Datenschutz abwägen. Aufgelöst ist der Widerspruch damit nicht. Breiter Zugriff braucht eine Ausschlussliste, und die habe ich noch nicht geschrieben: Journal, Kundendaten, Personenbezogenes aus dem Schulalltag — was davon grundsätzlich draussen bleibt, ist offen und gehört in Teil zwei.
Wie ein solcher Zugriff konkret aussieht — mit welchen Suchregeln, welchen Beziehungsebenen und welchen Stufen — beschreibe ich im zweiten Teil.
Einwände und Antworten
1. «Assoziativer Zugriff ist doch längst gelöst — das nennt sich Suche über die eigenen Dokumente.»
Technisch ja, konzeptionell nicht ganz. Suche optimiert auf Ähnlichkeit zur Frage. Was ich brauche, ist ein zweiter Modus, der bewusst danebengreift: Notizen aus einem anderen Bereich, die denselben Begriff anders verwenden. Das ist keine andere Technik, sondern ein anderes Rankingkriterium — und genau deshalb heisst die Frage «nach welchen Regeln», nicht «mit welchem Werkzeug».
2. «Die Verflachungsstudien messen Massenphänomene, nicht deinen Einzelfall.»
Stimmt, und das ist der wichtigste Vorbehalt. Die Befunde zeigen kollektive Homogenisierung. Ob mein persönlicher Kontext dagegen schützt oder den Effekt nur individualisiert, ist offen. Genau deshalb formuliere ich eine Hypothese und keine These.
3. «Wenn dein System ohnehin funktioniert — wozu dann die KI?»
Weil ich auf den Sparring-Chat nicht verzichten will. Nicht zum Denken, sondern zum Widersprechen, Zusammenfassen und Vorstrukturieren.
Ein Wort zum Begriff: Ich schreibe Sparring-Chat, nicht Sparringpartner. Die Rolle ist erforscht — ein System, das kooperativ und herausfordernd zugleich arbeitet, ohne zu über- oder unterfordern [13]. Im Englischen heisst die weichere Variante «thought partner» [14]. Beide Begriffe treffen die Funktion und verfehlen die Sache. Ein Partner hat eine eigene Position. Ein Chat hat keine. Sparring-Chat heisst für mich deshalb: ein Chatverlauf, den ich gezielt so anlege, dass er meine Position prüft, statt sie zu bestätigen. Das Ziel ist Erweiterung, nicht Ersatz.
4. «Das klingt nach viel Systempflege für wenig Ertrag.»
Der Aufwand ist real, aber er fällt ohnehin an. Ich pflege mein Wissenssystem seit Jahren aus eigenem Interesse. Dass es jetzt zusätzlich als Kontext taugt, ist ein Nebeneffekt, kein Zusatzprojekt.
Abschlussgedanken
Wo ich stehe, in drei Sätzen:
- Meine Wissensarbeit funktioniert — System, Schreibtisch und Routinen tragen.
- Die Verbindung zum LLM ist heute bewusst und punktuell, aber nicht assoziativ.
- Der nächste Schritt heisst: assoziativer Zugriff mit eingebauter Divergenz — sonst bekomme ich mein eigenes Denken geglättet zurück.
Eine Beobachtung zum Schluss. Ich habe diesen Text mehrfach überarbeitet, und jedes Mal stand da wieder «mein Wissenspartner». Ich merke, wie schwer es mir fällt, das nicht zu personifizieren.
Genau darin liegt das Risiko. Ein System, das mir mit meinen eigenen Worten antwortet, fühlt sich wie ein Gegenüber an. Es bleibt ein Werkzeug. Und ob es meine Wissensarbeit öffnet oder mir nur meinen eigenen Durchschnitt zurückgibt, entscheidet sich nicht am Modell. Es entscheidet sich daran, nach welchen Regeln es suchen darf.
Wenn du dein System erst aufbaust: In der Roadmap zum Second Brain zeige ich in 12 Kapiteln, wie Aufgaben, Notizen und PARA zu einem Second Brain zusammenwachsen — die Grundlage für alles, was danach mit KI möglich wird.
Quellen & Referenzen
Eigene Grundlagen
- mindOS Roadmap 2026 – Baue dein Second Brain
- Digital Workplace Design — Lern- und Arbeitsumgebung als Gestaltungsaufgabe
- Tiago Forte: The Master Prompt 2.0 — Live Session · Building a Second Brain / PARA
Verflachung: Homogenisierung der Ergebnisse
- [1] Doshi & Hauser (2024): Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances.
- [2] Anderson, Shah & Kreminski (2024): Homogenization Effects of Large Language Models on Human Creative Ideation. C&C '24.
- [3] Padmakumar & He (2024): Does Writing with Language Models Reduce Content Diversity? ICLR 2024.
- [4] Tilburg University (2026): Does generative AI make us think alike? A systematic review and three-level meta-analysis — 19 Studien, 61 Effektstärken.
- [5] Sourati, Ziabari & Dehghani (2026): The homogenizing effect of large language models on human expression and thought. Trends in Cognitive Sciences.
- [6] Sourati et al. (2025): The shrinking landscape of linguistic diversity in the age of large language models.
Verflachung: Wissensbestand und Modelle
- [7] Wright et al. (2025): Epistemic Diversity and Knowledge Collapse in Large Language Models.
- [8] Shumailov et al. (2024): AI models collapse when trained on recursively generated data. Nature 631, 755–759.
Verflachung: Wirkung auf uns selbst
- [9] Kosmyna et al. (2025): Your Brain on ChatGPT — Accumulation of Cognitive Debt. MIT Media Lab, Preprint.
- [10] Lee et al. (2025): The Impact of Generative AI on Critical Thinking. CHI '25.
- [11] Gerlich (2025): AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking. Societies 15(1).
Gegenevidenz und Hebel
- [12] Wan & Kalman (2025): Diverse AI Personas Can Mitigate the Homogenization Effect in Human-AI Collaborative Ideation. Computers in Human Behavior: AI.
Begriffe und Rollenmodelle
- [13] Herrmann (2025): AI as a Sparring Partner — An HCAI Approach to Promote Human Capabilities. AI-HCI 2025 (HCII), S. 162–176.
- [14] Collins et al. (2024): Building machines that learn and think with people. Nature Human Behaviour 8, 1851–1863.
Und erhalte regelmässig Gedanken aus meinem digitalen Garten.