Focus-Stacking: durchgängige Schärfe von vorn bis hinten

 

 

12. August 2026Technik

 

Wer eine Holzmaserung, eine Blüte oder eine bestückte Leiterplatte aus kurzer Distanz fotografiert, kennt den Moment der Ernüchterung: Auf dem Display sieht alles gut aus, in der 100-Prozent-Ansicht ist ein schmaler Streifen scharf und der Rest zerfließt. Das ist kein Bedienfehler und keine Frage des Objektivpreises, sondern Physik. Je näher die Kamera an das Motiv rückt, desto dünner wird die Zone, die gleichzeitig scharf abgebildet werden kann. Focus-Stacking ist die Antwort darauf. Hinter diesem Beitrag steht die Gigapixel GmbH — das spezialisierte Large-Format-Stockportal: echte Gigapixel-Aufnahmen ab 100 MP, kein KI-Upscaling. In unserer Produktion ist Stacking ein tägliches Werkzeug, kein Sonderfall.

 

Das Problem: Schärfentiefe schrumpft auf Millimeter

 

Schärfentiefe ist der Bereich vor und hinter der Fokusebene, den das Auge noch als scharf akzeptiert. Bei einer Landschaftsaufnahme reicht dieser Bereich von wenigen Metern bis unendlich. Im Nahbereich kippt das Verhältnis dramatisch. Kurt Wirz beschreibt in seiner Dokumentation zum Focus-Stacking (2023), dass die Schärfentiefe bei einem Abbildungsmaßstab von 1:1 — das Motiv wird also in Originalgröße auf den Sensor projiziert — nur noch wenige Millimeter beträgt. Bei starker Vergrößerung darüber hinaus schrumpft sie in den Mikrometerbereich.

 

Was das praktisch bedeutet, zeigt eine Tischlerei-Aufnahme. Eine gehobelte Eichenplatte liegt schräg im Bild, die Maserung läuft von der vorderen Kante nach hinten weg. Der Höhenunterschied zwischen der vordersten Faser und der hinteren Kante beträgt vielleicht drei Zentimeter. Bei einer Nahaufnahme, die die Poren des Holzes zeigen soll, ist das eine Ewigkeit: Fokussiert man auf die Mitte, sind vorne und hinten unscharf. Dasselbe gilt für eine Blüte, deren Staubgefäße in unterschiedlichen Ebenen stehen, oder für ein Bauteil mit Lötstellen auf verschiedenen Höhen.

 

Der naheliegende Reflex lautet: abblenden. Kleinere Blende, mehr Schärfentiefe. Dieser Reflex führt in eine Falle mit zwei Böden.

 

Warum Abblenden das Problem nicht löst

 

Erster Boden: die effektive Blende

 

Im Nahbereich entspricht die eingestellte Blende nicht der tatsächlich wirksamen. Die Optik folgt hier einer einfachen, bekannten Beziehung: effektive Blende = eingestellte Blende × (1 + Abbildungsmaßstab). Bei einem Maßstab von 1:1 wirkt eine eingestellte Blende von f/16 also wie f/32. Wer im Makrobereich glaubt, moderat abzublenden, arbeitet in Wahrheit längst im extremen Bereich — mit allen Folgen, die der zweite Boden beschreibt.

 

Zweiter Boden: Beugung

 

Licht, das durch eine kleine Öffnung fällt, wird gebeugt. Ein Punkt wird nicht mehr als Punkt abgebildet, sondern als Scheibchen. Je kleiner die Blendenöffnung, desto größer dieses Scheibchen — und desto weniger Details kann der Sensor noch trennen. Jenseits der optimalen Blende gilt eine ernüchternde Faustregel: Jede weitere Blendenstufe halbiert die darstellbare Auflösung. photoscala.de (thoMas, 2012) hat das für Vollformat durchgerechnet:

Blende (Vollformat)Darstellbare AuflösungVerhältnis zu f/5,6
f/5,6ca. 60 MP100 %
f/11ca. 15 MPca. 25 %
f/22ca. 3,7 MPca. 6 %

 

Von f/5,6 auf f/22 bleiben rund sechs Prozent der ursprünglich darstellbaren Auflösung übrig. Ein 60-Megapixel-Sensor liefert bei f/22 die Detailmenge einer alten Kompaktkamera. Man kauft Schärfentiefe und bezahlt mit Detailauflösung — im Großformatdruck genau die falsche Währung.

 

Wirz (2023) hat diesen Effekt gemessen: Konventionell auf f/16 bis f/22 abgeblendet ergibt sich in der Bildmitte ein Auflösungsverlust von über 40 Prozent. Eine Aufnahmeserie, die bei kritischer Blende zwischen f/4 und f/8 arbeitet und anschließend gestapelt wird, verliert dagegen nur 0 bis 4 Prozent. Das ist der eigentliche Grund für Focus-Stacking: nicht Bequemlichkeit, sondern Detailerhalt. Mehr zum physikalischen Hintergrund im Beitrag Diffraktionslimit in der Gigapixel-Fotografie.

 

So funktioniert Focus-Stacking

 

Statt einer Aufnahme mit erzwungener Tiefenschärfe entsteht eine Serie. Die Kamera bleibt fest, das Motiv bleibt fest, und die Fokusebene wandert in definierten Schritten durch das Motiv — von der vordersten bis zur hintersten Kante. Jede Einzelaufnahme entsteht bei kritischer Blende, also dort, wo das Objektiv sein Auflösungsmaximum erreicht und die Beugung noch nicht zuschlägt.

 

Anschließend fusioniert die Software die Serie. Sie bewertet für jedes Bildareal, welche Aufnahme dort die höchste lokale Kantenschärfe zeigt, und setzt das Endbild aus diesen scharfen Zonen zusammen. Das Ergebnis ist ein Bild, das über die gesamte Tiefe scharf ist, ohne je abgeblendet worden zu sein. Die methodischen Grundlagen für die Aufnahme und Betrachtung sehr großer Bilddatensätze haben Kopf et al. (2007) beschrieben; die dort entwickelten Prinzipien für Erfassung und Multiresolution-Darstellung sind bis heute die Basis praktisch aller Gigapixel-Workflows.

 

Zwei Bedingungen sind nicht verhandelbar: Das Motiv muss still stehen, und die Schrittweite muss zur Schärfentiefe passen. Sind die Schritte zu groß, entstehen unscharfe Bänder zwischen den Fokusebenen — ein Fehler, der sich im Nachhinein nicht reparieren lässt.

 

Produktionspraxis der Gigapixel GmbH

 

Der folgende Abschnitt beschreibt unsere eigene Produktionspraxis und beruht auf Firmenwissen der Gigapixel GmbH, nicht auf einer externen Quelle.

 

In unserer Produktion hat Stacking einen zweiten, seltener diskutierten Effekt: Es holt die Auflösung zurück, die die Beugung der Einzelaufnahme kostet. Mehrfachaufnahmen derselben Stelle tasten das Motiv mit jeweils leicht anderen Pixellagen ab — denn so ruhig ein Motiv auch steht, für das Sensorraster steht es nie vollkommen still. Jede Aufnahme trifft minimal versetzt, und bei der Fusion steht dadurch mehr echte Bildinformation zur Verfügung, als ein einzelner Auslösevorgang liefern könnte. Stacking bringt die reale Auflösung damit bis an den Sensor-Nennwert zurück — und je nach Motiv darüber hinaus.

 

Die Größenordnung aus unserer Praxis: Ein 50-Megapixel-Sensor löst bei Arbeitsblende f/8 wegen der Beugung nur noch rund 30 Megapixel echte Detailinformation je Einzelaufnahme auf — eine Stufe unter dem Optimum, die Halbierungsregel aus der Tabelle oben. Ein Stack aus rund acht Aufnahmen derselben Stelle gleicht genau das aus: Am Ende stehen wieder rund 50 Megapixel echte Bildinformation, je nach Motiv auch etwas mehr. Dasselbe Grundprinzip nutzt die Kameraindustrie aktiv: Hasselblads Multi-Shot-Verfahren verrechnet sechs um ganze und halbe Pixel versetzte Aufnahmen eines 50-Megapixel-Mittelformatsensors zu einer 200-Megapixel-Datei (Hasselblad, 2014) — dort mit gezielter Sensorverschiebung, bei uns über die natürliche Mikroverschiebung zwischen den Aufnahmen.

 

Entscheidend ist dabei der Unterschied zu generativen Verfahren: Jedes Pixel bleibt gemessen. Es stammt aus Licht, das tatsächlich auf den Sensor gefallen ist. Das ist das Gegenteil dessen, was KI-Upscaling tut. Kim et al. (2025) haben gezeigt, dass Hochskalierungsverfahren bei extremen Vergrößerungen kollabieren: Sie erfinden Strukturen, statt sie zu messen. Für ein Stockportal, dessen Kunden Bilder auf Wandgröße bringen, ist das der Kern der Sache — ausführlicher im Vergleich echter Aufnahmen mit KI-Hochskalierung.

 

Unsere Gigapixel-Produktion läuft seriell und automatisiert, mit Stacking bis hinab zu einer Motivhöhe von einem Zentimeter.

 

Wo durchgängige Schärfe den Unterschied macht

 

Handwerk und Material. Eine Tischlerei, die ihre Arbeit zeigen will, verkauft nicht das Möbelstück, sondern die Oberfläche: Porenbild, Hobelspur, Kantenverleimung. Diese Details liegen selten in einer Ebene.

 

Produkt- und Technikaufnahmen. Ein Werkzeug, ein Ventil, eine Baugruppe soll von der vordersten Kante bis zur hinteren Fassung lesbar bleiben. Nur so lässt sich das Bild später auch beschneiden, ohne dass unscharfe Zonen sichtbar werden.

 

Makro. Bei Blüten, Insektenflügeln oder mineralischen Strukturen ist Stacking schlicht die einzige Möglichkeit, das Motiv vollständig scharf zu zeigen.

 

Wand- und Deckennähe. Wer ein Motiv aus einem halben Meter Abstand betrachtet, hat eine harte Messlatte: Nach Ashraf, Chapiro & Mantiuk (2025) löst das Auge etwa 94 ppd — Pixel pro Grad — auf, individuell bis 120 ppd. Auf einen Betrachtungsabstand von 0,5 m umgerechnet entspricht das 274 ppi. Bei einem Meter sind es 137 ppi, bei zwei Metern 68 ppi. Ein Motiv, das aus Armlänge betrachtet wird, muss diese Detaildichte über die gesamte Fläche tragen — inklusive der Tiefe. Grundlagen dazu im Beitrag Was ist Gigapixel-Fotografie?.

 

Industrielle Inspektion. In der automatisierten optischen Inspektion ist Stacking längst Standard. Die Basler AG (2025) beschreibt eine Lösung, bei der ein FPGA zehn Aufnahmen mit je 5,1 Megapixel in 67 Millisekunden zu einem durchgängig scharfen Bild fusioniert — schnell genug für den Inline-Betrieb. In der Leiterplatten- und BGA-Prüfung macht das Verfahren Mikro-Voids und Koplanaritätsabweichungen sichtbar, also Fehler, die auf einer einzelnen Fokusebene unentdeckt blieben.

 

Häufige Fragen

 

Wie viele Aufnahmen braucht ein Stack?

Es gibt keine feste Zahl, weil die nötige Menge direkt von der Schärfentiefe der Einzelaufnahme und der Tiefenausdehnung des Motivs abhängt. Die Rechnung ist im Kern simpel: Man teilt die Tiefe des Motivs durch die Schärfentiefe einer Einzelaufnahme und nimmt einen Sicherheitszuschlag, damit sich die scharfen Zonen überlappen. Bei einem flachen Motiv wie einer leicht schrägen Holzplatte können acht bis fünfzehn Aufnahmen genügen. Im Makrobereich, wo die Schärfentiefe nach Wirz (2023) bei 1:1 nur wenige Millimeter beträgt und bei stärkerer Vergrößerung in den Mikrometerbereich fällt, sind mehrere Dutzend bis über hundert Aufnahmen normal. Entscheidend ist nicht die Gesamtzahl, sondern die Schrittweite: Sie muss kleiner sein als die Schärfentiefe der Einzelaufnahme. Sonst entstehen unscharfe Bänder zwischen den Fokusebenen, die kein Fusionsalgorithmus reparieren kann, weil die scharfe Information an dieser Stelle schlicht nie aufgenommen wurde. In unserer seriellen Produktion arbeiten wir mit etwa zehn Aufnahmen je Stelle — nicht als Maximum, sondern als Arbeitspunkt, der Sicherheit gegen Fokusdrift und lokale Störungen gibt.

 

Erhöht Stacking wirklich die Auflösung oder nur die Schärfentiefe?

Beides — aus zwei Gründen, die man auseinanderhalten sollte. Die Schärfentiefe wächst direkt durch das Verfahren: Aus mehreren Fokusebenen entsteht ein durchgängig scharfes Bild. Der Auflösungsgewinn hat zwei Quellen. Die erste ist extern belegt: Weil jede Einzelaufnahme bei kritischer Blende zwischen f/4 und f/8 entsteht statt bei f/16 oder f/22, entfällt die Beugungsstrafe — Wirz (2023) misst über 40 Prozent Auflösungsverlust beim konventionellen Abblenden gegenüber 0 bis 4 Prozent beim Stacking. Die zweite Quelle ist die Mehrfachabtastung: Auch bei kritischer Blende begrenzt die Beugung, was eine Einzelaufnahme auflöst — ein 50-Megapixel-Sensor liefert bei f/8 nur rund 30 Megapixel echte Detailinformation. Weil das Motiv für das Sensorraster nie vollkommen still steht, tastet jede weitere Aufnahme mit minimal anderen Pixellagen ab; ein Stack aus rund acht Aufnahmen holt so wieder die vollen rund 50 Megapixel, je nach Motiv mehr. Dasselbe Prinzip nutzt Hasselblads Multi-Shot mit gezielter Sub-Pixel-Verschiebung: 50-Megapixel-Sensor, 200-Megapixel-Datei (Hasselblad, 2014). Die konkreten Werte unserer Produktion sind Firmenwissen der Gigapixel GmbH — jedes Pixel bleibt dabei gemessen.

 

Warum nicht einfach f/22?

Weil f/22 die Detailauflösung zerstört, die man eigentlich gewinnen will. Jenseits der optimalen Blende halbiert jede weitere Blendenstufe die darstellbare Auflösung. photoscala.de (thoMas, 2012) beziffert das für Vollformat: Bei f/5,6 sind rund 60 Megapixel darstellbar, bei f/11 noch etwa 15 Megapixel und bei f/22 nur noch ungefähr 3,7 Megapixel. Von der ursprünglichen Detailmenge bleiben also rund sechs Prozent. Man tauscht Schärfentiefe gegen Auflösung — und zwar zu einem sehr schlechten Kurs. Im Nahbereich verschärft sich das Problem zusätzlich, weil die effektive Blende von der eingestellten abweicht: Es gilt: effektive Blende = eingestellte Blende × (1 + Abbildungsmaßstab), sodass f/16 bei einem Maßstab von 1:1 bereits wie f/32 wirkt. Wer glaubt, moderat abzublenden, ist längst im extremen Bereich. Für ein Bild, das später auf Wandgröße gedruckt oder im Zoomviewer bis in die Struktur hinein betrachtet wird, ist dieser Verlust nicht akzeptabel. Stacking bei kritischer Blende umgeht den Zielkonflikt vollständig.

 

Geht Stacking bei bewegten Motiven?

Nein. Focus-Stacking setzt zwingend voraus, dass Motiv und Kamera zwischen den Einzelaufnahmen unverändert bleiben. Der Fusionsalgorithmus vergleicht dieselben Bildareale über die gesamte Serie hinweg und wählt pro Areal die schärfste Aufnahme aus. Bewegt sich das Motiv, zeigen die Aufnahmen an derselben Bildposition unterschiedliche Motivteile — der Algorithmus setzt dann Fragmente zusammen, die nicht zusammengehören. Sichtbar wird das als Geisterkanten, doppelte Konturen oder ausgefranste Übergänge. Schon leichte Bewegung genügt: ein Luftzug an einer Blüte, Vibration im Boden, eine schwankende Aufnahmeplattform. Deshalb sind alle klassischen Stacking-Anwendungen statisch — Handwerksstücke, Produkte, Präparate, mineralische Strukturen, Leiterplatten. Für bewegte Szenen ist das Verfahren nicht geeignet, und es gibt dafür auch keinen sinnvollen Umweg. In der industriellen Inspektion löst man das Problem über Geschwindigkeit statt über Stillstand: Die Basler AG (2025) beschreibt die Fusion von zehn Aufnahmen mit je 5,1 Megapixel in 67 Millisekunden, sodass das Bauteil während der Serie praktisch stillsteht. Für die klassische Motivfotografie gilt diese Abkürzung nicht — dort bleibt ein stabiles Stativ, ein erschütterungsfreier Untergrund und ein windgeschützter Aufbau die Voraussetzung. Wer im Freien mit Pflanzen arbeitet, wartet auf die ruhige Minute oder schirmt das Motiv ab.

 

Fazit

Schärfentiefe im Nahbereich lässt sich nicht durch Abblenden gewinnen, ohne genau das zu verlieren, worum es geht: Detailauflösung. Focus-Stacking löst den Zielkonflikt, indem es jede Aufnahme bei kritischer Blende entstehen lässt und die scharfen Zonen anschließend fusioniert. Für uns ist das die Grundlage jeder Nahaufnahme — und der Grund, warum unsere Motive auch aus einem halben Meter Abstand tragen. Gigapixel GmbH — das spezialisierte Large-Format-Stockportal: echte Gigapixel-Aufnahmen ab 100 MP, kein KI-Upscaling.

 

Quellen

  • Ashraf, M., Chapiro, A. & Mantiuk, R. K. (2025): Resolution limit of the eye — how many pixels can we see? Nature Communications.
  • Kim et al. (2025): Chain-of-Zoom.
  • photoscala.de / thoMas (2012): Wie viele Megapixel verkraftet eine Kamera?
  • Wirz, K. (2023): Focus Stacking. focus-stacking.ch.
  • Hasselblad (2014): H5D-200c MS — Multi-Shot mit Sub-Pixel-Sensorverschiebung, 50-MP-Sensor zu 200-MP-Datei. Herstellerdokumentation.
  • Basler AG (2025): Integrated Focus Stacking Solution for AOI Systems.
  • Kopf, J. et al. (2007): Capturing and Viewing Gigapixel Images. ACM ToG.