Archiv der Kategorie: Bildbearbeitung

Bildbearbeitung, Künstliche Intelligenz, Tutorials

Ausführliches Tutorial: Interaktive 360°-KI-Bilder mit Midjourney erstellen

15. Februar 2024 Robert Kneschke Ein Kommentar

Auf meiner Facebook-Seite hatte ich hier kürzlich gefragt, wie groß das Interesse sei, die Erstellung von solchen interaktiven 360°-Bildern zu lernen:

Da der Andrang groß war, gibt es heute das komplette Tutorial, wie ihr diese 360-Grad-Bilder selbst erstellen und anzeigen lassen könnt. Klickt gerne mit der Maus auf das Bild, um die Ansicht zu ändern oder unten rechts auf das „VR“-Symbol, um das Gleiche im Vollbild-Modus zu machen.

1. Die Bilderstellung

Zuerst braucht ihr dafür natürlich Zugang zu einem Generativen KI-Programm. Ich arbeite bevorzugt mit Midjourney, aber getestet habe ich es auch mit Dall‑E 3 und prinzipiell sollte es – je nach Qualität des KI-Generators – auch mit anderen Tools wie Adobe Firefly oder Stable Diffusion funktionieren.

Als Prompt habe ich bei Midjourney diesen hier verwendet (die eckige Klammer sollte weggelassen werden, mehr dazu unten):

/imagine 360° equirectangular photograph of [an empty futuristic spaceship commando room interior] –ar 2:1 –v 6.0 –style raw

Wichtig sind hier vor allem die ersten beiden Begriffe 360° und die gleichwinklige Projektion (equirectangular projection) sowie das Seitenverhältnis von 2:1, welches im Midjourney-Prompt durch das Parameter-Kürzel –ar definiert wird.

Bei der gleichwinkligen Projektion wird diese aus einem einzigen Bild zusammengesetzt, wobei der horizontale Winkel 360° und der vertikale 180° beträgt. Daher sollte das Seitenverhältnis 2:1 sein, um unnötige Verzerrungen zu vermeiden. Adobe Firefly kommt z.B. nur bis zum Seitenverhältnis 16:9, weshalb die Ergebnisse weniger überzeugend aussehen.

Die Versionsnummer (v6) und der Style (raw) sind Geschmackssache und können variiert werden. Ich habe diese gewählt, weil sie aktuell die beste Renderqualität (v6) liefern bei realistisch anmutendem Ergebnis (raw).

Statt des Raumschiff-Prompts in der eckigen Klammer könnt ihr natürlich eurer Fantasie freien Lauf lassen. Beim oben verlinkten Facebook-Post lautete der Prompt zum Beispiel:

/imagine 360° equirectangular photograph of the rainforest –v 6.0 –ar 2:1 –style raw

Ihr könnt aber auch deutlich elaborierter in eurer Beschreibung werden, wenn ihr wollt.

Midjourney zeigt euch dann vier Auswahlmöglichkeiten an. Hier solltet ihr bei der Wahl eures Favoriten schon darauf achten, ob die linke und rechte Bildkante sich halbwegs dazu eignen, miteinander verbunden zu werden.

Im obigen Beispiel habe ich mit einem roten Pfeil markiert, wo die KI einen Lichteinfall gerendert hat, der sich nicht auf der rechten Kante wiederfindet. Das würde die optische Illusion zerstören. Beim oberen linken Bild sind oben und unten schwarze Balken, die ebenfalls störend sind. Daher habe ich mich für das Bild links unten entschieden.

Hinweis: Es gibt in Midjourney auch den Parameter „–tile“, der dafür sorgen soll, dass die Bilder nahtlos kachelbar sind, was für unsere Zwecke erst mal prinzipiell gut klingt. Manchmal funktioniert es auch gut, aber leider achtet Midjourney dann auch darauf, dass die obere und untere Kante zusammenpassen, was bei Außenaufnahme, wo oben Himmel und unten Erde ist, selten gute Ergebnisse bringt. Bei Innenaufnahmen ist die Trefferquote höher. Daher: Einfach mal testen.

Das fertige Bild wird mit „U3“ vergrößert (upscaling) und dann noch mal „Upscale (Subtle)“ vergrößert. Damit haben wir schon eine Auflösung von 1536x3072 Pixeln. Wer will, kann diese Auflösung mit einer der hier aufgezählten Upscale-Methoden noch weiter erhöhen. Das Raumschiff-Bild habe ich mit Topaz Photo AI auf 3072x6144 Pixel vergrößert.

Wie schon oben erwähnt, funktioniert es prinzipiell auch mit ChatGPT, wenn auch das Seitenverhältnis nicht korrekt als 2:1 ausgegeben wurde und die fertige Auflösung geringer ist:

2. Die Bildbearbeitung

Das fertige PNG-Bild öffne ich nun in Photoshop und wähle den Befehl „Verschiebungseffekt“ (unter Filter/Sonstige Filter):

Im sich öffnenen Menüfenster gebe ich nun „horionzal +1000 Pixel nach rechts“ ein. Wichtig ist, dass unten die Option „Durch verschobenen Teil ersetzen“ aktiv ist.

Damit verschiebt sich das Bild um eintausend Pixel nach rechts und wir sehen auch im Screenshot schon, wo die Nahtkante unseres Bildes ist. Diese können wir mit den Photop-Bordmitteln wie „generatives Entfernen“, „generatives Füllen“ und den altbekannten Stempel-Werkzeugen bearbeiten, bis die Kante nicht mehr so stark erkennbar ist. Tipp: Einfach den Übergang komplett mit dem rechteckigen Auswahlwerkzeug markieren und „Generatives Füllen“ anklicken, wirkt oft wahre Wunder.

Hier meine bearbeitete Version:

Zusätzlich könnt ihr natürlich je nach Belieben das Bild vom Farbton, Kontrast etc. anpassen oder andere Bildbereiche verbessern, entfernen oder austauschen.

Wenn ihr fertig seid, könnt ihr den „Verschiebungseffekt“ in die andere Richtung (also ‑1000) anwenden, damit das Bild wieder in seine Ausgangsposition verschoben wird.

Das ist nicht unbedingt notwendig, aber die meisten 360°-Anzeigen nutzen die Bildmitte als Startpunkt, welcher dadurch von uns beeinflusst werden kann.

Das fertige Bild sollte als JPG abgespeichert werden.

3. Die Bild-Metadaten

Damit Tools unser Bild nun auch als „echtes“ 360°-Bild erkennen, müssen wir manuell Metadaten hinzufügen, welche durch 360°-Kameras erzeugt werden. Wir täuschen damit quasi vor, unser KI-Bild sei mit einer richtigen Kamera aufgenommen worden.

Das sind die notwendigen Metadaten:

-xmp:ProjectionType=equirectangular
-xmp:CroppedAreaLeftPixels=0
-xmp:CroppedAreaTopPixels=0
-xmp:CroppedAreaImageWidthPixels=3072
-xmp:CroppedAreaImageHeightPixels=1536
-xmp:FullPanoWidthPixels=3072
-xmp:FullPanoHeightPixels=1536
-xmp:UsePanoramaViewer=true

Die Pixelwerte können (und sollten) natürlich abweichen, wenn euer Bild andere Pixelmaße aufweist.

Damit ihr nicht wie der letzte Höhlenmensch in eure EXIF-Daten eingreifen müsst, gibt es verschiedene Offline- und Online-Tools, welche das für euch übernehmen.

Ich nutze selbst gerne den „Exif Fixer Online“. Dieser unterstützt JPG-Bilder bis zu 15 MB. Nach dem Hochladen des Bildes erhaltet ihr einen Link, wo ihr die „gefixte“ Version mit den korrekten Metadaten runterladen könnt:

WICHTIG: Damit die Datei als 360°-Bild ausgelesen werden kann, müssen diese Metadaten intakt bleiben. Das Versenden der Datei mit Whatsapp oder Email etc. kann dazu führen, dass diese Metadaten wieder gelöscht werden und das Bild nicht interaktiv angezeigt werden kann.

4. Die Anzeige

Kommen wir zur Belohnung für unsere Mühen. Damit wir das 360°-Bild anzeigen lassen können, müssen wir es irgendwo hochladen, wo diese Art der Anzeige unterstützt wird.

Hier im Blog habe ich auf die Schnelle das kostenlose Plugin „Algori 360 Image“ installiert, es gibt aber auch etliche andere.

Eine andere Möglichkeit ist das Hochladen des Bildes bei Facebook oder Google Photos. Zusätzlich gibt es hier eine Liste von weiteren Apps, welche diese 360°-Anzeige unterstützen.

5. Galerie und Material zum Testen

Wer sehen will, dass das oben kein Glückgriff war, sondern auch mehrmals funktioniert, kann sich hier meine „360° KI-Bilder“-Galerie auf Facebook ansehen.

Wer gerade keinen Zugriff auf einen KI-Generator hat, kann sich die Rohdaten für die Galerie-Bilder hier runterladen, direkt ohne Bildbearbeitung aus Midjourney exportiert. Die jeweiligen Prompts findet ihr in den Metadaten in der Bildbeschreibung oder in der Facebook-Galerie.

Wichtiger Hinweis: Die Bilder sind die rohen Ausgangsbilder, es müssen also weiterhin die Schritte 2–4 durchlaufen werden, wenn die Bilder 360°-tauglich werden sollen. Alternativ könnt ihr die Bilder direkt in der Galerie ansehen.

Bildbearbeitung, Künstliche Intelligenz

Der große KI-Upscaler-Test: Vergleich von Bildqualität, Kosten und mehr

23. Oktober 2023 Robert Kneschke 19 Kommentare

Was ist der aktuell beste KI-Upscaler?
Vor wenigen Tagen hat die KI-Firma Midjourney einen neuen Upscaler veröffentlicht, der deren KI-Bilder um den Faktor 2 oder 4 vergrößern kann.

Da ich bisher ein anderes Tool genutzt habe, wollte ich herausfinden, wie sich die Bildqualität unterscheidet. Wo ich schon dabei war, habe ich noch paar andere Upscaler verglichen und die Ergebnisse bei Facebook und LinkedIn gepostet. Da gab es in den Kommentaren noch weitere Vorschläge, welche Upscaler ich berücksichtigen sollte.

Na gut, dachte ich mir, dann ziehe ich das eben größer auf und veröffentliche hier einen umfassenden Test über die Bildqualität und Unterschiede der aktuell auf dem Markt erhältlichen Upscaler.

Alle Testausschnitte im direkten Vergleich (Klicken zum Vergrößern)

Der Testaufbau und das Ausgangsbild

Ich habe mir mit dem KI-Tool Midjourney ein quadratisches PNG-Bild einer blonden Frau generieren lassen mit der Auflösung 1024x1024 Pixel (1,05 Megapixel):

Dieses Bild habe ich dann mit verschiedenen Methoden um den Faktor 4 auf 4096x4096 Pixel (16,7 Megapixel) vergrößern lassen.

Da die Beurteilung der Ergebnisse subjektiv gefärbt ist und jeder andere Maßstäbe an seine Bilder anlegt, veröffentliche ich hier auch die PSD-Datei der verschiedenen Ergebnisse als Download, jede Ebene ist sauber nach der genutzten Upscaler-Methode benannt.

DOWLOAD-Link (Dropbox) als gepackte .rar-Datei (ACHTUNG: Datei ist 610 MB groß, entpackt dann 889 MB!) BACKUP-Link (Wetransfer).

Damit kann jede*r durch das Ein- und Ausblenden der Ebenen in der 100%-Ansicht selbst entscheiden, welches Ergebnis ihm/ihr am meisten zusagt.

Für diesen Blogartikel habe ich einen Bereich des linken Auges ausgeschnitten, damit hier die 100%-Ansicht (500x500 Pixel) gezeigt werden kann. Die Ausschnitte habe ich sauber benannt und als JPG (Qualität 10) abgespeichert. Der Ausschnitt ist in der Photoshop-Datei auch als Pfad hinterlegt.

Der große Upscaler-Test: Die Ergebnisse

1. Midjourney Upscaler

Beginnen wir mit dem Upscaler von Midjourney. Obwohl dieser erst wenige Tage alt ist, gibt es schon zwei Versionen und Midjourney behält sich vor, den Upscaler auch in Zukunft zu verändern/verbessern:

„The upscaler is subtle and tries to keep details as close as possible to the original image (but may not fix glitches or issues with the old image)“

Die erste Version (V1) des Midjourney-Upscaler bügelte die Hauttextur ziemlich glatt, das ganze Bild wirkt insgesamt sehr nach 1980er-Jahre-Airbrush-Retusche.

Das Entwickler-Team nahm sich die Kritik der Community jedoch zu Herzen und schob zwei Tage später das erste Update hinterher:

„We’re […] hearing everyone’s feedback that the 4x upscaler is a bit soft and we’re looking at improvements which may further improve things. This means the upscaler settings may change suddenly over the next week without warning as we tweak things.
[…]
The V5 4x Upscale now features improved sharpness, and in some cases smaller scale high frequency details“

Dadurch sieht das Ergebnis deutlich besser aus, die Haare und Wimpern sehen täuschend echt aus und auch die Hauttextur kann überzeugen:

Der erste große Nachteil dieses Upscalers ist logischerweise, dass er nur auf KI-Bilder anwendbar ist, die direkt in Midjourney erstellt wurden.

Ein weiterer Punkt sind die Kosten: Der 4x Upscaler kostet grob 6x soviel GPU-Minuten wie die Generierung eines 4x4-Bilder-Grids. Diese Zeit wird von dem bezahlten Minutenkontingent abgezogen, welches die Nutzer je nach Abomodell zur Verfügung haben. Im Standard-Plan sind das zum Beispiel 15 Stunden pro Monat.

Eine Stunde Rechenzeit kann aktuell für 4 USD dazu gekauft werden. Ich habe mal geschaut, wie viel Zeit für ein 4x-Upscale von Midjourney berechnet wird. Beim obigen Bild waren das ca. 3 Minuten. Mit einer Stunde Rechenzeit könnten damit 20 Bilder hochskaliert werden. Bei Kosten von 4 USD/Stunde würde ein Upscale ca. 20 US-Cent kosten. Wer die inklusiven Stunden im Standard- oder Pro-Plan nutzt, zahlt nur die Hälfte.

2. Topaz Photo AI

Der Upscaler von Topaz Labs war unsere bisherige bevorzugte Upscale-Methode. Getestet haben wir hier mit der Version 2.0.5.
Topaz Photo AI ist ein recht neues Tool, mit dem verschiedene KI-basierte Werkzeuge wie Topaz Gigapixel, Topaz Sharpen etc. zusammengefasst wurden.

Die Ergebnisse sehen sehr überzeugend aus, vor allem die Hauttextur ist sehr realistisch, die Details wie Wimpern und Haare sind jedoch etwas gröber.

Topaz hat auch eine Funktion namens „Recovering Face“, womit laut Hersteller die Ergebnisse von Gesichtern in geringer bis mittlerer Auflösung deutlich verbessert werden kann:

„Recover Faces dramatically improves low-medium quality faces.“

Es gibt einen Regler, der stufenlos von 0 bis 100% eingestellt werden kann. Bei 25% sieht das Ergebnis so aus:

Topaz Photo AI V2 Upscaler 4x + 25% Recovering Face

Ich finde, dass das Gesicht dadurch einfach matschiger wird. Dieser Effekt nimmt mit der Stärke der Recover-Funktion zu, bei 100% ist das Ergebnis deutlich unbrauchbarer als ganz ohne die Funktion. Vermutlich liegt das daran, dass die Bildqualität vom Ausgangsmaterial schon „zu gut“ für diese Funktion ist, die der Verbesserung von „low quality faces“ dienen soll.

Ein weiterer Vorteil von Topaz Photo AI ist, dass hier Bilder als Batch bearbeitet werden können und neben dem Hochskalieren im gleichen Arbeitsgang wahlweise auch geschärft, entrauscht, farblich angepasst etc. werden können.

Mit 199 USD sind die Kosten initial recht hoch, dafür können damit unbegrenzt Bilder bearbeitet werden und es gibt regelmäßige Updates. Für Vielnutzer preislich die beste Wahl. Weiterer Pluspunkt: Es gibt ein Photoshop-Plugin.

3. Photoshop

Die früher übliche und seit langem verfügbare Methode mit Photoshop-Bordmitteln war, einfach die Bildgröße hochzusetzen. Das Ergebnis, getestet mit Photoshop 2024 (V25.0), sieht dann so aus:

Photoshop-Vergrößerung V25 (Berechnung: Automatisch)

Es ist damit sichtbar mit Abstand das schlechteste Ergebnis, was wenig verwundert, da hier noch keine KI Hilfestellung leistet. Selbst mit dem bekannten Kniff, das Bild in 10%-Schritten hochzuskalieren, war das Ergebnis nur minimal besser und reicht trotzdem nicht an die anderen Methoden heran.

In den Kommentaren zu meinem ersten Test gab es zwei Hinweise, wie ich die Ergebnisse verbessern könnte. Der erste war, dass sich hinter dem Häkchen „Neu berechnen“ noch eine Auswahlmöglichkeit für „Details erhalten 2.0“ verbirgt:

Photoshop-Vergrößerung V25 (Berechnung: Details erhalten 2.0)

Das Ergebnis ist zwar „besser“ und schärfer, dafür aber mit sichtbaren Artefakten übersät. Wenn ich den Regler „Rauschen reduzieren“ auf 50% setze, verschwinden die Artefakte, aber das Bild sieht etwas weichgezeichnet aus.

Kurz: Der schlechteste Upscaler im Test. Es wundert mich etwas, dass hier die Adobe Sensei-KI noch nicht Einzug gehalten hat, aber vermutlich wird das ein Feature sein, was eher früher als später veröffentlicht werden wird.

Jemand meinte noch, dass sich unter den „Neural Filters“ ein „Superzoom“-Filter verberge. Das ist jedoch kein richtiger „Upscaler“, weil damit das Bild tatsächlich „rangezoomt“ wird, ich verliere also die Bildmotive am Rand.

Dafür sind die Kosten jedoch unschlagbar, da jeder mit einem Photoshop-Abo unbegrenzt viele Bilder hochskalieren kann.

Kurzes Update 23.10.2023: (sample images not included in download yet)
Einige Leser wiesen mich darauf hin, dass die „Superzoom“-Funktion doch das ganze Bild anzeigt, wenn die Option „Bild > Alles einblenden“ genutzt wird. Zusätzlich gibt es einige Auswahlmöglichkeiten wie z.B. „Gesichtsdaten verbessern“ und „JPG Artefakte reduzieren“:

Photoshop Neural Filter „Superzoom“ mit „Gesichtsdaten verbessern“ und „JPG Artefakt-Reduzierung“ aktiv

Das Ergebnis sieht schon besser als mit der alten Photoshop-Methode aus und rangiert damit im oberen Mittelfeld. Für die Top-Liga sind die Bereiche wie Haare oder Wimpern noch etwas zu matschig.

Außerdem bietet Adobe in Lightroom oder Camera Raw die „Verbessern“-Option, welche ebenfalls hochskaliert, aber nur bei Raw-Dateien funktionieren soll.

4. Luminar Neo

Luminar Neo ist, ähnlich wie Topaz Labs, ein weiteres KI-gestütztes Tool-Kit für die Fotobearbeitung mit vielen Funktionen. Getestet wurde hier mit der Version 1.14.1.12230 im Upscale Type „Universell“.

Gefühlt würde ich sagen, dass das Ergebnis irgendwo zwischen Midjourney und Topaz liegt. Die Details sind etwas gröber als bei den anderen beiden Upscalern, die Haut weichgezeichneter als bei Topaz, aber weniger als bei Midjourney.

Luminar Neo Hochskalieren 4x + Gesichtsverstärker AI

Es gibt bei der Hochskalieren-Funktion noch das optionale Häkchen „Gesichtsverstärker AI“, welches jedoch schlicht gesagt (bisher) grausame Ergebnisse liefert. Es sieht so aus als würde hier ein Geisterbild über dem anderen liegen. Kurz: Finger weg von dem Häkchen.

Die Kosten von Luminar Neo liegen bei 219 Euro für die lebenslange Nutzung, es gibt aber auch Abo-Modelle ab 11,95 Euro/Monat, was sich gut zum Testen eignet. Dafür bekommt man aber nicht nur die Hochskalieren-Funktion, sondern ein breites Bündel an Werkzeugen wie Entrauschen, Schärfen, Lichtmanipulationen, und vieles mehr. Die Handhabung mit dem separaten Installieren der verschiedenen Plugins finde ich jedoch nicht ganz intuitiv.

5. Pixelcut

Pixelcut ist ein kostenloser Online-Upscaler, welcher bequem via Drag & Drop funktioniert.

Das Ergebnis ist relativ grob, aber besser als Photoshop. Dafür sind die Kosten gleich null. Für Gelegenheitsnutzer also sehr praktisch.

Es ist auch eine Batch-Nutzung möglich, die dann jedoch im „Pixelcut Pro“ 9.99 USD pro Monat oder 59.99 USD im Jahr kostet. Dafür ist dann auch eine iPhone/Android-App-Nutzung enthalten und unbegrenzte Hintergrundentfernung.

6. Neural.love

Neural.love ist ein online-basierter AI-gestützter HD Portrait-Generator, der als Leserhinweis seinen Eingang in diesen Test fand.

Der Leistungsumfang reicht von der direkten KI-Bilderstellung über Image-to-Image Bildremixe, Portraitrestaurierungen etc. und eben auch ein Upscaler namens „Image Enhance/Quality Enhance“.

Das Ergebnis ist etwas detaillierter als bei Pixelcut, reicht aber von der Schärfe nicht an Topaz oder Midjourney heran.

Es gibt noch die Option, „Smart Noise“ zu aktivieren, was – wie der Name schon vermuten lässt – ein feines Rauschen über das Bild liegt. In der 100%-Ansicht ist das recht auffällig, beim Rauszoomen ist der Eindruck aber positiver als ohne das Rauschen.

Das Online-Tool erfordert eine Registrierung per Email und arbeitet mit einem Credit-System für die Kosten. Die ersten fünf Credits sind frei (also 5x Upscaling), danach können 300 Credits im Abo für 30 Euro/Monat oder zeitlich unbegrenzt für 57 Euro gekauft werden. Das wären dann 10 bzw. 19 Cent pro Upscale.

7. Upscale.media

Upscale.media ist ein weiterer Online-Upscaler auf Credit-Basis:

Das Ergebnis rangiert solide im Mittelfeld und ist schon gut brauchbar.

Upscale.media 4x Upscaler + Qualität verbessern

Es gibt auch die Option, ein Häkchen bei „Qualität verbessern“ zu setzen, doch das scheint das Gegenteil zu bewirken. Das Bild verliert an Details und die Konturen werden unnatürlich stark betont. Würde ich nicht empfehlen.

Kosten? Pro Tag sind zwei Uploads ohne Registrierung kostenlos möglich, nach Registrierung gibt es fünf kostenlose Uploads. 100 Credits kosten im Abo 19 USD bzw. zeitlich unbegrenzt 49 USD, was 19 US-Cent bzw. 49 US-Cent pro Upscaling entspricht.

8. Stable Diffusion Upscaler

Auch im quelloffenen KI-Generator Stable Diffusion gibt es gleich mehrere Upscaler. Hier öffnet sich aber auch die Büchse der Pandora, weil es neben den sieben verschiedenen Upscalern, die im Web-UI von Automatic111 dabei sind, noch unzählige weitere gibt, die auch jeweils noch viele verschiedene Settings haben.

Allein in der Datenbank OpenModelDB finden sich unter „General Upscaler“ 66 verschiedene Modelle, die kostenlos heruntergeladen und installiert werden können und alle ihre Stärken und Schwächen haben.

Um die Sache noch komplexer zu machen, können Bilder auch mittels der „IMG2IMG“-Methode hochskaliert werden, wobei hunderte verschiedene KI-Modelle zur Auswahl stehen.

Deshalb habe ich hier nur mal einen internen Upscaler getestet, den Upscaler „ESRGAN_4x“ mit einer GFPGAN visibility von 0.5.

Stable Diffusion Upscaler ESRGAN_4x (GFPGAN visibility 0.5)

Das Ergebnis ist ca. doppelt so gut wie die Photoshop-Methode, aber sichtbar schlechter als die meisten anderen Upscaler im Test.

Dazu kommt, dass die Geschwindigkeit des Skalierens ganz stark von der lokal verwendeten Hardware abhängt. Mit einer RTX 2080-Grafikkarte dauerte das Hochskalieren über 15 Minuten. Wer die Settings noch etwas mehr hochdreht, muss exponentiell länger warten.

Auch die Bedienung gestaltet sich komplex, da die Modelle gefunden und runtergeladen werden müssen und für die verschiedenen Settings keine Anleitung existiert. Ihr werdet also auf etlichen Webseiten rumsurfen, um euch die empfohlenen Einstellungen zusammenzusuchen.
Dafür sind die Kosten fast Null, da alle benötigten Tools kostenlos erhältlich sind. Ihr zahlt also nur für euren Strom.

Wer mehr Stable Diffusion Upscaler im Vergleich sehen will, findet hier einen ähnlichen Test.

9. ChaiNNer Upscaler

ChaiNNer ist ein weiterer Tipp aus den Kommentaren. Das ist ein OpenSource-Projekt, welches ursprünglich als KI-Upscaler gestartet ist, mittlerweile aber sehr umfangreiche Bildverarbeitungsfunktionen bietet.

ChaiNNER ist node-basiert, was sehr ungewohnt ist, für die, die es nicht kennen, aber wer das Prinzip verstanden hat, kann auf diese Weise sehr komplexe Workflow-Ketten aufbauen, die dann mit einem Klick abgearbeitet werden. Der Workflow für das einfache Hochskalieren sieht dann so aus:

ChaiNNer-Upscaling-Workflow (Klicken zum Vergrößern)

Das Programm ist noch in der Alpha-Phase (ich habe v0.20.2 genutzt) und kostenlos für Windows, Mac und Linux erhältlich. Die Installation erfordert etwas Zeit, ist aber in der GitHub-Anleitung gut beschrieben.

ChainNNer selbst ist genau genommen gar kein Upscaler, sondern dient als GUI (grafische Benutzeroberfläche) für andere OpenSource-Upscaler auf PyTorch-Basis. Das heißt, fast alle Upscaler die bei Stable Diffusion integriert werden können, sind auch in ChaiNNer nutzbar. Wie im Bereich „Stable Diffusion“ erwähnt, stehen euch also mindestens 66 verschiedene Möglichkeiten zur Verfügung.

ChaiNNer 4x Upscaler mit Model „Remacri“

Getestet habe ich ChaiNNer mit dem beliebten „Remacri“-Modell, welches eine überzeugende Kombination aus Schärfe und Struktur liefert. Ebenfalls nicht ganz so gut wie Topaz oder Midjourney, dafür kostenlos und seeehr flexibel.

ChaiNNer 4x Upscaler mit Model „UniScale-Balanced“

Ich habe noch ein weiteres Modell getestet, das „UniScale-Balanced“ auf Basis der ESRGAN-Architektur. Das schnitt jedoch deutlich schlechter ab als „Remacri“.

Noch mal zum Verständnis: In Stable Diffusion und ChaiNNer können die gleichen Upscaler-Modelle eingesetzt werden, bei mir lief die Verarbeitung jedoch deutlich schneller bei ChaiNNer. Dafür gibt es bei Stable Diffusion etwas mehr Einstellmöglichkeiten, die ich auf die Schnelle nicht bei ChaiNNer gefunden habe.

Das Resultat

Es gibt noch unzählige weitere Tools, vor allem online, aber die meisten davon rangieren im Mittelfeld und sind preislich ähnlich angesiedelt.

Von der Bildqualität liegt Midjourney aktuell meiner Meinung nach stark vorne, hat eben aber den gravierenden Nachteil, dass damit nur Midjourney-Bilder hochskaliert werden können. Auch preislich ist Midjourney kein Zuckerschlecken, wenn man nicht gerade eh Stunden übrig hat in deren Abo-Modell.

Für Power-User, die mehr als 1000 Bilder hochskalieren wollen, bleibt die Wahl zwischen Topaz Photo AI und Luminar Neo preislich die bessere Wahl, wobei Topaz in der Bedienung wegen der Automatisierungsmöglichkeiten etwas die Nase vorn hat.

Insgesamt ist die Qualität aber auch subjektiv behaftet und kann sich je nach Motiv oder mit einem Update eines Tools auch wieder ändern.

Bei den ganzen, teils kostenlosen, Online-Upscalern solltet ihr auch bedenken, dass ihr eure Daten in fremde Hände gebt und dem Anbieter vertrauen solltet, damit vertraulich umzugehen. Vermutlich werden auch die meisten dieser Anbieter unter der Haube eines der unzähligen OpenSource-Upscaler laufen haben.

Welchen Upscaler nutzt ihr aktuell und welches Ergebnis hat euch hier am meisten überzeugt?

Die Community-Test-Erweiterung

Wer den Test mit eigenen Modellen oder anderen Anbietern erweitern will, hat in diesem Artikel alle notwendigen Grundlagen: Das 1024x1024-Ausgangsbild steht oben zum Download zur Verfügung sowie die Photoshop-Datei mit den Ebenen der Upscaler und der Pfad-Auswahl für die Ausschnittvergrößerung.

Ihr könnt also gerne weitere Methoden testen und das Ergebnis gerne in den Kommentaren posten (Bilder bitte als Link).

Bildbearbeitung, Künstliche Intelligenz

Generatives Füllen in Adobe Photoshop – Erste Erfahrungen mit der Beta

26. Juni 2023 Robert Kneschke Ein Kommentar

Seit einigen Wochen gibt es in der Beta-Version von Adobe Photoshop die Möglichkeit, den neuen „Generative Füllung“-Befehl auszuprobieren. Das ist quasi die Integration der Adobe Firefly-KI direkt als Tool in Photoshop, mit der ihr beliebige Elemente direkt in eure Bilder generieren lassen könnt – durch künstliche Intelligenz.

In den letzten Wochen habe ich einige Beispiele der neuen KI-Fähigkeiten auf meiner Facebook-Seite gezeigt (also folgt mir dort, falls ihr schneller informiert werden wollt), aber je mehr ich die Funktion nutze, desto mehr bekam ich das Gefühl, dass ich damit den neuen Möglichkeiten nicht gerecht würde.

Deshalb will ich heute einige meiner Experimente im Blog vorstellen, damit ihr eine Ahnung davon bekommt, was alles – nicht in Zukunft – sondern ab sofort in Photoshop möglich ist.

Was ist der „Generative Fill“-Befehl in Photoshop?

Seit der neusten Photoshop-Version werden je nach Werkzeug und Aktion im Bild häufig genutzte Befehle in einer Shortcut-Leiste eingeblendet. Wenn eine Markierung, also so eine gestrichelte Linie, aktiv ist, ist der erste Befehl in der Beta-Version von Photoshop der „Generative Fill“.

Wer darauf klickt, kann entweder Text in ein Bedienfeld eintippen oder einfach direkt auf „Generieren“ klicken. Wer Text eingibt, gibt damit den „Prompt“ an (vergleichbar mit der Texteingabe bei KI-Tools wie Midjourney, Stable Diffusion oder Dall‑E 2), welchen die KI zu einem Bildinhalt umwandeln soll. Wer darauf verzichtet, gibt der KI freie Hand bei der Motivauswahl und die KI versucht dann, den markierten Bereich so zu füllen, dass er sich nahtlos ins vorhandene Bild einpasst.

Damit handelt die KI quasi wie beim Befehl „Inhaltsbasiertes Füllen“, nur in deutlich besserer Qualität und mit dem Unterschied, dass die Füllung nicht aus dem bestehenden Bild genommen wird, sondern aus den Trainingsdaten der KI. Das hat den Vorteil, dass deutlich größere Bereiche gefüllt werden können und keine unnatürlichen Wiederholungsmuster entstehen, wie das beim „inhaltbasierten Füllen“ manchmal der Fall war.

Möglichkeiten in der Beta-Version

Die Adobe-eigene KI „Firefly“ befindet sich aktuell in der Betaphase zum Testen für die nicht-kommerzielle Nutzung und auch das „Generative Füllen“ in der Beta-Version von Photoshop ist aktuell nur für nicht-kommerzielle Anwendungen freigegeben.

In den letzten Tagen habe ich verstärkt bewusst nur mit der Beta-Version gearbeitet und probiert, an welchen Stellen die KI mich bei der Arbeit unterstütze könnte. Okay, manchmal habe ich auch einfach nur rumgealbert und ausprobiert, ob die KI meine lustigen Ideen glaubhaft umsetzen könnte.

Schauen wir uns einige der Ergebnisse an:

Das männliche Model hat vergessen Bescheid zu geben, dass er sich seit dem Sedcard-Shooting verändert hat und taucht am Set mit einem Schnauzbart auf? Kein Problem, einfach markieren und weg ist der Bart.

Das Model trägt nur ein Hemd, soll aber wie die anderen Personen im Bild einen dunklen Anzug tragen? Oder einen roten? Oder ein T‑Shirt? Oder einen Neoprenanzug? Oder doch lieber eine Lederjacke?
Auch hier kein Problem, den Körper markieren und in das Feld für die generative Füllung das gewünschte Kleidungsstück auswählen.

Im KI-Bild ist die Smartwatch am Handgelenk nur matschiger Brei? Dann halt mit der zweiten KI, also hier Firefly, ein passendes Display für die Uhr generieren.

Beim Gruppen-Businessfoto will der Kunde mehr Diversität im Bild haben? Einfach paar Köpfe im Hintergrund markieren und gegen andere austauschen.

Diesen Trick nenne ich „den Trotzki machen“: Eine Person auf dem Foto soll verschwinden, wie auf dem Lenin-Foto von Grigori Goldstein im Jahr 1920? Einfach markieren und auf „generative Füllung“ klicken. Wer ins Textfeld stattdessen eine andere Personenbeschreibung einfügt, kann die Person auch austauschen.

Ihr habt eine Aufnahme und wollt „rauszoomen“? Geht jetzt einfach, indem ihr die Leinwand vergrößert und den nun leeren Teil markiert und generativ füllen lasst. Der schwarze Rahmen dient hier als Markierung, alles außerhalb davon ist KI-generiert, innerhalb ist eine Drohnenaufnahme.

Aerial view of rural landscape in Ellenberg, Germany in summer

Die Karre vor eurer Haustür ist zu klein? Einfach markieren und zack, wird ein Panzer draus.
Hier wird auch erkennbar, wie problematisch diese Technik für die Erstellung von „Fake News“ sein kann.

Das Generative Füllen funktioniert nicht nur mit Teilen vom Bild. Auch eine komplett leere Leinwand kann markiert und gefüllt werden, wie hier in meinem Beispiel mit einem Dschungel. Im nächsten Schritt habe ich den Dschungel mit etlichen Tieren bevölkert.

Erkenntnisse des Beta-Tests

Es ist leicht erkennbar, wie mächtig und nützlich das neue KI-Tool in Photoshop sein kann. Bei den meisten Fällen liefert die Generative Füllung ganze Arbeit. Nur bei einigen Prompts versteht Photoshop (bisher) einfach nicht, was gemeint ist. Beim obigen Beispiel, wo ich zuerst die Person entfernt und danach mit einer Frau ersetzt habe, wollte ich eigentlich „Batman“ sehen, aber da hat wohl ein interner „Intellectual Property“-Filter angeschlagen und das Ergebnis in eine andere Richtung gelenkt.

Mehrmals stieß ich aber auch bei meiner Meinung nach unverfänglichen Bearbeitungen auf die Fehlermeldung „Die erzeugten Bilder wurden entfernt, da sie gegen Benutzerrichtlinien verstoßen“ und Photoshop lieferte einfach keine oder weniger als drei Ergebnisse. Das passierte zum Beispiel manchmal, wenn ich schiefe, krumme Zähne von KI-Portraits markiert hatte und – ohne konkreten Prompt – schönere Zähne haben wollte. Aber auch, wenn ich Gebäudefassaden aufhübschen oder reparieren wollte, erhielt ich ab und zu Meldung, was nach einer Weile den Workflow unschön unterbrach.

Die KI in Photoshop liefert generell knackscharfe Ergebnisse, aber vor allem bei größeren Auflösungen kommt die KI manchmal an ihre Grenzen und die KI-Füllungen werden unscharf. Das liegt dann meist daran, dass der markierte Bereich größer als ein Megapixel (1024x1024 Pixel) ist. Bis zu dieser Größe arbeitet die KI bisher nativ, alles was größer ist, wird künstlich hochskaliert, was eben zur Unschärfe führen kann. Eine mögliche Abhilfe ist hier, bei großen Aufträgen die Fläche in kleinere Bereiche zu unterteilen und die „Generative Füllung“ mehrmals laufen zu lassen.

Die Vergütung der Urheber an den Trainingsdaten

Adobe wirbt damit, dass deren KI im Gegensatz zu gewissen anderen Anbietern rechtlich und ethisch „sauber“ sein soll, weil die Trainingsdaten alle legal genutzt worden seien.

Adobe beruft sich hier vor allem darauf, dass sie die Bilder aus ihrem Adobe Stock-Portfolio für Trainingszwecke verwendet haben. Das ist in den Nutzungsbedingungen für Adobe Stock-Anbieter vom 15. April 2022 geregelt, wo es plötzlich heißt:

„You grant us a non-exclusive, worldwide, perpetual, fully-paid, and royalty-free license to use, reproduce, publicly display, publicly perform, distribute, index, translate, and modify the Work for the purposes of operating the Website; presenting, distributing, marketing, promoting, and licensing the Work to users; developing new features and services; archiving the Work; and protecting the Work.“
(Hervorhebung durch mich)

Bezahlt wurden die Adobe Stock-Anbieter bisher für ihre Trainingsdaten noch nicht, was das „ethisch“ etwas grauer werden lässt. Zurecht sind daher einige Adobe Stock-Anbieter etwas sauer, dass sie weder bezahlt noch richtig gefragt wurden. Die Änderung der Nutzungsbedingungen geschah wie üblich ohne große Ankündigung oder gar Verweise auf geplante KI-Trainings.

Immerhin schreibt Adobe eher nebenbei auf Twitter, dass eine Kompensation der Urheber geplant sei, wenn die Firefly-KI die Betaphase verlasse:

Was habt ihr bisher mit dem Tool umsetzen können?
Was ist eure Meinung zu dem Werkzeug?
Schreibt es gerne in die Kommentare.

Bildbearbeitung

Fotos von Geldscheinen in Adobe Photoshop öffnen und bearbeiten (Version 2021)

27. Januar 2021 Robert Kneschke Ein Kommentar

Vor fünf Jahren hatte ich hier schon mal einige (leider eher unbequeme Möglichkeiten) veröffentlicht, wie ihr die Geldschein-Sperre in Adobe Photoshop umgehen könnt, um nicht an der Fehlermeldung „Das Bearbeiten von Banknoten wird von dieser Anwendung nicht unterstützt“ zu scheitern.

Nun hat mir der Leser André Morre freundlicherweise eine Email geschickt, in der er mich auf eine weitere Möglichkeit hinwies. Diese ist erstens viel bequemer und funktioniert zweitens auch mit allen aktuellen Photoshop-Versionen.

André sagt, dass man das betroffene Foto einfach im ACR (Adobe Camera Raw), dem RAW-Entwickler von Photoshop öffnen soll.

Das geht z.B. in Adobe Bridge mit dem Befehl „In Camera RAW öffnen…“ oder durch Doppel-Klick auf eine RAW-Datei im Datei-Browser, wenn Photoshop als Datei-Standard für RAW-Dateien hinterlegt ist.

Ist die Datei dann offen, sieht es so aus (bei mir getestet mit der neusten Camera Raw Version 13.02):

Geldschein-Foto im Camera RAW-Editor von Adobe Photoshop

Statt „Öffnen“ klickt ihr nun oben rechts (siehe roter Pfeil) auf das unscheinbare „Konvertieren“-Symbol. Dann öffnet sich ein Fenster mit „Speicheroptionen“, wo ihr unter anderem mittig das gewünschte Format, z.B. PSD, TIFF, PNG oder JPG wählen könnt. Nun einfach dort „PSD“ auswählen und abspeichern.

Die so abgespeicherte Photoshop-Datei lässt sich nun problemlos in jeder Photoshop-Version öffnen. Getestet habe ich das mit der neusten Version V. 22.01 (Photoshop 2021).

Die Sperre zum Bearbeiten von Geldscheinen nennt sich Counterfeit Deterrence System (CDS) und wird von Adobe freiwillig implementiert, um das Fälschen von Geldscheinen zu erschweren. Das nervt jedoch auch Designer und Fotografen, welche Geldschein-Abbildungen für ihre Arbeit brauchen.

Deshalb noch der rechtliche Hinweis: Das Fotografieren und Bearbeiten von Banknoten ist erlaubt, es darf aber kein Falschgeld oder täuschend echtes Geld hergestellt werden.

Kennt ihr noch weitere, aktuelle Methoden, um die Sperre zu umgehen?

Update 27.1.2021: Hier ein weiterer Hinweis eines anderen Lesers: Die Datei kann auch in Capture One entwickelt und als PSD-Datei gespeichert werden, dann wird diese auch von Photoshop problemlos geöffnet.

Bildbearbeitung, Rezensionen, Verlosung

Praxis-Test: Fixel Recolor Plugin Panel für Photoshop (mit Verlosung)

20. Oktober 2020 Robert Kneschke 19 Kommentare

Mit wenigen Klicks den Bildlook eines Bildes auf ein anderes übertragen? Das klingt zu gut, um wahr zu sein und doch ist es das, was das „Fixel Recolor Panel“ für Adobe Photoshop verspricht.

„Fixel Recolor“ ist ein Photoshop Panel des deutschen Programmierers Thomas Zagler (Zusammerarbeit mit Fixel Algorithms), der schon einige solcher Plugin-Panels veröffentlicht hat.

Im Grunde besteht „Fixel Recolor“ aus zwei Arbeitsschritten.

Zuerst kann ein Bild analysiert werden, entweder ein offenes Bild in Photoshop, ein markierter Ausschnitt des Bildes oder ein Bild auf der Festplatte. „Fixel Recolor“ erstellt dann basierend auf diesem Bild eine Farbpalette, wahlweise mit 1 bis 20 verschieden Farben.

Diese so erstellte Farbpalette kann dann etwas bearbeitet werden, siehe dieser Screenshot:

Die Farben können nach Luminanz sortiert werden, alle Farben können der Photoshop-Bibliothek als einzelne „Farbfelder“ hinzugefügt werden oder die Farbwerte können etwas verschoben („shift“) werden.

Die Kernaufgabe des Plugins ist es jedoch, diese Farbpalette als Preset zu speichern oder direkt auf ein anderen Bild anzuwenden.

In den Einstellung gibt es dazu mehrere Möglichkeiten, wie genau die Farbplatte angewendet werden soll:

Als Mischmodus kann „Weiches Licht“, „Hartes Licht“ oder „Ineinanderkopieren“ gewählt werden und die Deckkraft kann definiert werden.

Wird die Farbpalette auf ein Bild angewendet, erstellt das Tool eine neue „Verlaufsumsetzung-Ebene“ über der aktiven Ebene mit dem gewünschten Ebenenmodus, welcher auch nachträglich geändert werden kann.

Wie das in der Praxis wirken kann, sehr ihr hier an meinem Beispiel, rechts ist das Original zu sehen, links mit der Farbpalette aus dem Herbst-Bild:

Beim roten Pfeil sehr ihr, dass das Plugin nicht-destruktiv arbeitet und die Einstellungsebene einfach ausgeblendet oder wie in meinem Beispiel nur teilweise angewendet werden kann.

Prinzipiell funktioniert das Panel sehr gut, aber die Ergebnisse hängen logischerweise sehr stark sowohl von der Eingangs-Farbpalette als auch dem Bild ab, auf welches diese angewendet wird.

Werden die Farben oder Einstellungen zu extrem gewählt, wie hier in diesem Beispiel zu sehen (als Farbpalette wurden die 6 Regenbogen-Farben der LGBT-Flagge gewählt, Mischmodus „Ineinanderkopieren“):

Da viele Tools für das Erstellen von Farbpaletten meist nur eine fixierte Anzahl an Farben erlauben (Adobe Color zum Beispiel 5), ist „Fixel Recolor“ allein deshalb praktisch für Leute, die regelmäßig Farbpaletten erstellen müssen und die Farbanzahl selbst definieren wollen.

Das „Fixel Recolor“ Panel ist hier für 30 USD erhältlich.

Verlosung: 3x Fixel Recolor Plugin

Der Hersteller war so freundlich, mir drei Coupon-Codes zur Verfügung zu stellen, mit denen ihr das Plugin auch kostenlos erhalten könnt.

Alles, was ihr dafür tun müsst, ist, einen Kommentar unter diesem Artikel zu hinterlassen und darin den Satz „Ich würde Fixel Recolor gerne nutzen, um _____“ zu vervollständigen.

Unter allen gültigen Einsendungen verlose ich am 2.11.2020 die Codes, die Gewinner werden per Email benachrichtigt. Der Rechtsweg ist ausgeschlossen, viel Glück!