DEV Community

Cover image for Attention is all you have
Ashish
Ashish

Posted on

Attention is all you have

Wie „Attention is all you have“ unsere VR‑Dichoptik‑Engine inspiriert hat

Als ich neulich den Hacker‑News‑Thread „Attention is all you have“ (681 Punkte) las, fühlte ich mich ertappt. Die Diskussion drehte sich darum, wie Aufmerksamkeit zur knappsten Ressource geworden ist – nicht nur in Feeds, sondern auch in unseren eigenen neuronalen Bahnen. Ich saß in unserem kleinen Büro in Berlin, der Laptop surrte, die Meta Quest 2 lag neben mir, und ich dachte: Was, wenn wir genau diese Knappheit nutzen, um das schwächere Auge wieder ins Spiel zu bringen? Genau da setzt Amblyotube an, das wir bei Seven Sports für die Meta Quest gebaut haben.

Technisch gesehen ist die App ein klassisches Unity‑Projekt mit dem Meta XR SDK. Der Kern ist eine dichoptische Render‑Pipeline: zwei unabhängige Render‑Textures, eine pro Auge, die wir zur Laufzeit mit eigenen Shadern füttern. Der YouTube‑Player läuft ganz normal im Hintergrund, aber bevor das Bild die Linsen erreicht, trennen wir den Stream per Shader in zwei Kanäle. So erhält das dominante Auge eine gedämpfte Version (der Dominant Eye Shader), während das schwache Auge (das „lazy eye“) gezielt geschärft und stimuliert wird. Keine Gamification, keine Belohnungssysteme – reines passives Training während du dir deine Lieblingsvideos ansiehst.

Der Dominant Eye Shader lässt dich Blur, Contrast, Brightness und Opacity justieren. Bei voller Opazität wirkt er wie ein digitales Pflaster, aber der eigentliche Trick ist die partielle Schattierung: beide Augen bleiben aktiv, das Gehirn muss lernen, die beiden Streams zu fusionieren. Parallel dazu läuft der Lazy Eye Sharpener (MFBF). Eine leichte AI‑Erkennung (ein kleiner TensorFlow‑Lite‑Graph, der auf der Quest‑GPU inference‑fähig ist) detektiert menschliche Figuren im Video und legt einen Schärfefilter exklusiv auf das schwache Auge. Das passiert frame‑genau, ohne spürbare Latenz, weil wir die Inferenz in einen Compute‑Shader verlagert haben.

Ein weiteres Feature ist die Flicker Stimulation. Wir modulieren die Helligkeit der erkannten Figuren mit einer niedrigen Frequenz (≈ 2 Hz). Die Netzhaut ist evolutionär auf Bewegungs‑ und Lichtwechsel programmiert; der kontrollierte „Ruck“ reizt die entsprechenden Pfade, ohne dass der Nutzer es bewusst wahrnimmt. Ergänzt wird das durch den Magenta Focus Cue: ein wandernder, magentafarbener Kreis, der nur dem schwachen Auge angezeigt wird, während das dominante Auge einen neutralen Graukreis sieht. Magenta taucht in natürlichen Videos kaum auf, bleibt also gegen jeden Hintergrund sichtbar und zwingt das Gehirn zur Fusion – ein direkter Hebel für Neuroplastizität.

In den letzten Updates haben wir Visual Accents hinzugefügt. Im MFBF‑Modus kannst du jetzt einen sanften Highlight (gelb‑grüner Glow) oder einen Outline (rote Silhouette) um Personen legen. Beide lassen sich per Pulse Controls in einem „Atem‑Rhythmus“ (einstellbare Hz) pulsieren, damit die Aufmerksamkeit nicht ermüdet. Die Parameter sind alle über ein einfaches UI im Headset justierbar – keine Code‑Änderungen nötig.

Was mich persönlich am meisten beeindruckt hat, war der Moment, als ich die erste Testsession mit einem 14‑jährigen Patienten (Einwilligung der Eltern, selbstverständlich) durchführte. Er saß auf dem Sofa, Kopfhörer auf, und schaute einen Minecraft‑Let’s‑Play. Nach 35 Minuten – die empfohlene Obergrenze – nahm er die Brille ab, blinzelte und sagte: „Das fühlt sich an, als würde ich zum ersten Mal richtig depth sehen.“ Kein medizinisches Versprechen, nur ein subjektives Erlebnis, das genau das widerspiegelt, was die Literatur zur dichoptischen Therapie beschreibt: binokulares Training verbessert Tiefenwahrnehmung und verringert die Abhängigkeit vom Pflastern.

Sicherheitsseitig halten wir uns strikt an die Guidelines: Nutzer ab 13 Jahren, korrekte Augen‑Selektion im Menü, Sessions 30‑40 Minuten, nie länger als eine Stunde. Amblyotube ist ein Trainings‑ und Assistenzwerkzeug, kein medizinisches Gerät, kein Ersatz für ärztliche Versorgung. Wir dokumentieren das offen in der App und auf der Store‑Seite.

Wenn du dich als Entwickler für die Render‑Pipeline interessierst: der Quellcode bleibt geschlossen, aber wir teilen regelmäßig Learnings zu Multi‑Eye‑Rendering, Shader‑Graph‑Optimierungen und der Integration von On‑Device‑Inference in einem Blog‑Post‑Series auf unserem Dev‑Log. Vielleicht inspiriert dich der nächste HN‑Thread genauso wie mich.

Probier es selbst aus und sieh, wie sich Aufmerksamkeit in visuelle Koordination verwandelt: https://www.meta.com/en-gb/experiences/amblyotube/25906906972338493/

Top comments (0)