<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Emre Demir</title>
    <description>The latest articles on DEV Community by Emre Demir (@emree_demir).</description>
    <link>https://dev.to/emree_demir</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3821679%2F6e70a234-c701-4cfd-b54c-26469311e90f.png</url>
      <title>DEV Community: Emre Demir</title>
      <link>https://dev.to/emree_demir</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/emree_demir"/>
    <language>en</language>
    <item>
      <title>Video auf 40 Sekunden verlängern mit Gemini Omni 1.1 Flash</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Fri, 28 Aug 2026 08:33:51 +0000</pubDate>
      <link>https://dev.to/emree_demir/video-auf-40-sekunden-verlangern-mit-gemini-omni-11-flash-505g</link>
      <guid>https://dev.to/emree_demir/video-auf-40-sekunden-verlangern-mit-gemini-omni-11-flash-505g</guid>
      <description>&lt;h1&gt;
  
  
  Gemini Omni 1.1 Flash: Videos per Szenenerweiterung auf 40 Sekunden verlängern
&lt;/h1&gt;

&lt;p&gt;Gemini Omni 1.1 Flash generiert 10-sekündige Clips. Mit der Szenenerweiterung fügen Sie pro Aufruf weitere 10 Sekunden hinzu – bis zu einer kumulativen Länge von 40 Sekunden.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog heute testen&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Die Funktion existierte bereits im Vorabmodell, war damals aber nur eingeschränkt brauchbar: Als Kontext diente lediglich die letzte Sekunde des bisherigen Materials. Dadurch blieben Farben grob konsistent, während Kleidung, Kamerabewegungen und andere Details häufig wechselten.&lt;/p&gt;

&lt;p&gt;Die &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GA-Veröffentlichung vom 27. August 2026&lt;/a&gt; erweitert den Kontext auf die letzten 10 Sekunden. Google beschreibt das Ergebnis als &lt;a href="https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash" rel="noopener noreferrer"&gt;„verbesserte visuelle Konsistenz und narrative Kohärenz“&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Dieser Leitfaden zeigt, wie Sie Szenen erweitern, welche Grenzen gelten und wie Sie verhindern, dass eine 40-sekündige Sequenz im dritten Segment auseinanderfällt.&lt;/p&gt;

&lt;h2&gt;
  
  
  Der grundlegende Erweiterungsaufruf
&lt;/h2&gt;

&lt;p&gt;Die Erweiterung verwendet die Files API. Laden Sie den Clip hoch und übergeben Sie dessen URI zusammen mit einem Prompt, der die nächste Handlung beschreibt:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;google&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;genai&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;genai&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;Client&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

&lt;span class="n"&gt;video_file&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;files&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;upload&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;file&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;my_video.mp4&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;interaction&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;interactions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gemini-omni-1.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;document&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;uri&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;uri&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Continue the scene.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;extended.mp4&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;wb&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;write&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;base64&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;b64decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;interaction&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;output_video&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;data&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Uploads werden asynchron verarbeitet. Fragen Sie deshalb zunächst den Dateistatus ab:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;

&lt;span class="k"&gt;while&lt;/span&gt; &lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;state&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;PROCESSING&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;sleep&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;10&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;video_file&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;files&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;name&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;name&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;state&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FAILED&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;raise&lt;/span&gt; &lt;span class="nc"&gt;ValueError&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;state&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Wenn das Video aus Omni in derselben Sitzung stammt, können Sie den Upload überspringen und die Interaktions-ID verketten. Dieser Pfad spart Tokens und erhält mehr Sitzungszustand:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;res2&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;interactions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gemini-omni-1.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;previous_interaction_id&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;res1&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nb"&gt;id&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;The camera pulls back to reveal the whole street.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Der &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-omni-1-1-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Walkthrough&lt;/a&gt; behandelt weitere Optionen, darunter Auflösung und Auslieferungsformat.&lt;/p&gt;

&lt;h2&gt;
  
  
  Einen Charakter in die Erweiterung einbeziehen
&lt;/h2&gt;

&lt;p&gt;Sie können Referenzmedien an eine Erweiterung anhängen und im Prompt darauf verweisen. Hochgeladene Referenzen erhalten Slots wie &lt;code&gt;&amp;lt;IMAGE_REF_0&amp;gt;&lt;/code&gt; und &lt;code&gt;&amp;lt;IMAGE_REF_1&amp;gt;&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;video_file&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;files&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;upload&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;file&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;my_video.mp4&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;character_img&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;files&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;upload&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;file&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;character.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;interaction&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;interactions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gemini-omni-1.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;document&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;uri&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;uri&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;document&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;uri&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;character_img&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;uri&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Extend this video: have the character shown in &amp;lt;IMAGE_REF_0&amp;gt; enter the scene and wave.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Videoreferenzen werden ebenfalls unterstützt, sind aber auf drei Clips mit jeweils maximal drei Sekunden begrenzt. Das Modell nutzt sie für Bewegung und Aussehen; Audio aus Referenzclips wird ignoriert.&lt;/p&gt;

&lt;h2&gt;
  
  
  Grenzen der Szenenerweiterung
&lt;/h2&gt;

&lt;p&gt;Bevor Sie eine Sequenz planen, sollten Sie diese Einschränkungen kennen:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;40 Sekunden sind das Maximum:&lt;/strong&gt; Eine Generierung plus drei Erweiterungen ergeben vier Segmente mit jeweils 10 Sekunden.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Erweiterungen hängen nur an:&lt;/strong&gt; Sie können kein Material am Anfang oder in der Mitte einfügen. Ist Segment zwei fehlerhaft, müssen Sie ab dort neu generieren.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Hochgeladene Eingaben dürfen maximal 10 Sekunden lang sein:&lt;/strong&gt; Mehrstufige Ketten mit &lt;code&gt;previous_interaction_id&lt;/code&gt; sind davon nicht betroffen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Keine Dialoge bei erweiterten Uploads:&lt;/strong&gt; Hochgeladene Clips können erweitert werden, aber beim Upload-Erweiterungspfad lässt sich kein Dialog hinzufügen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Regionale Einschränkungen:&lt;/strong&gt; Das Hochladen und Bearbeiten von Videos ist im Europäischen Wirtschaftsraum, in der Schweiz und im Vereinigten Königreich nicht verfügbar. Von Omni generierte Videos können dort weiterhin bearbeitet werden. Der Pfad über &lt;code&gt;previous_interaction_id&lt;/code&gt; funktioniert daher weiterhin, der Upload-Pfad nicht.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Nur ein Video als Eingabe:&lt;/strong&gt; Das Modell kann nicht über mehrere Eingabevideos hinweg Schlussfolgerungen ziehen.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Den gesamten Ablauf vor dem Rendering planen
&lt;/h2&gt;

&lt;p&gt;Eine 40-sekündige Sequenz in 720p kostet ungefähr 4,06 US-Dollar an Videoausgabe. Driftet die Geschichte im dritten Segment ab, müssen Sie oft die Segmente drei und vier neu generieren. Dabei können Details verloren gehen, die am Anfang von Segment drei noch funktioniert haben.&lt;/p&gt;

&lt;p&gt;Entwerfen Sie deshalb zunächst den gesamten Ablauf in 360p. Die Generierung ist bis zu 60 % schneller und kostet etwa ein Drittel. Die vier Segmente kosten dann ungefähr 1,35 US-Dollar. Sobald die Sequenz funktioniert, rendern Sie sie mit denselben validierten Prompts in 720p oder höher neu. Der &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisartikel&lt;/a&gt; enthält die vollständige Berechnung.&lt;/p&gt;

&lt;p&gt;Legen Sie die Auflösung im Antwortformat fest:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;interaction&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;interactions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gemini-omni-1.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;document&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;uri&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;video_file&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;uri&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Continue the scene.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;response_format&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;video&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;resolution&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;360p&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Prompts für vier stabile Segmente
&lt;/h2&gt;

&lt;p&gt;Die folgenden Muster funktionieren bei Erweiterungen zuverlässiger:&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Beschreiben Sie die Änderung, nicht die gesamte Szene.&lt;/strong&gt; Das Modell kennt bereits die letzten 10 Sekunden. Eine vollständige Wiederholung kann dazu führen, dass es die bestehende Szene neu interpretiert. „Die Kamera fährt auf die Tür zu“ ist besser als eine erneute Beschreibung des gesamten Raums.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Fordern Sie eine Bewegung pro Segment an.&lt;/strong&gt; Zwei Ereignisse innerhalb von zehn Sekunden führen häufig zu einer überstürzten Darstellung. Planen Sie pro Segment eine zentrale Aktion.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Definieren Sie Kontinuitätsanker.&lt;/strong&gt; Formulierungen wie „dieselbe rote Jacke“ oder „derselbe niedrige Kamerawinkel“ helfen dem Modell, wichtige Details über die Naht hinweg beizubehalten.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Akzeptieren Sie die Nur-Anhängen-Grenze.&lt;/strong&gt; Planen Sie die Sequenz in der tatsächlichen Wiedergabereihenfolge. Den Anfang später zu korrigieren, ohne nachfolgende Segmente neu zu generieren, ist nicht möglich.&lt;/p&gt;

&lt;p&gt;Der &lt;a href="https://apidog.com/de/blog/google-veo-3-prompt-theory?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Veo-Prompt-Leitfaden&lt;/a&gt; beschreibt weitere Prinzipien, die sich auch auf andere Videomodelle übertragen lassen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Erweiterungen reproduzierbar testen
&lt;/h2&gt;

&lt;p&gt;Vier verkettete Aufrufe erzeugen vier mögliche Stellen, an denen sich Modelländerungen bemerkbar machen. Speichern Sie deshalb jede Stufe als eigene Anfrage in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Legen Sie Datei-URIs und Interaktions-IDs in Umgebungsvariablen ab, damit Sie einzelne Segmente erneut ausführen können, ohne die gesamte Kette manuell aufzubauen.&lt;/p&gt;

&lt;p&gt;Prüfen Sie außerdem die Antwortstruktur. Eine Erweiterung mit höherer Auflösung kann die Datei über 4 MB vergrößern und dadurch den Wechsel von inline Base64 zu einer URI erforderlich machen. Setzen Sie das Timeout deutlich höher als den Standardwert, da Erweiterungen länger dauern als die ursprüngliche Generierung: Das Modell muss zunächst den 10-sekündigen Kontext analysieren.&lt;/p&gt;

&lt;p&gt;Der &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog-Download&lt;/a&gt; hilft beim Einrichten dieser Teststrecke.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Wie lang kann ein Gemini-Omni-Video sein?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Kumulativ 40 Sekunden: eine 10-sekündige Generierung plus drei 10-sekündige Erweiterungen.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kann ich ein selbst gefilmtes Video erweitern?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja, wenn die Eingabe maximal 10 Sekunden lang ist und Sie sich außerhalb des EWR, der Schweiz und Großbritanniens befinden. Laden Sie den Clip über die Files API hoch und übergeben Sie seine URI.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kann ich am Anfang eines Clips etwas hinzufügen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nein. Die Erweiterung fügt ausschließlich Material am Ende hinzu.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Warum ändert mein Charakter zwischen Segmenten sein Aussehen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Wahrscheinlich beschreibt Ihr Prompt die gesamte Szene neu, statt nur die nächste Änderung zu nennen. Benennen Sie explizit, was gleich bleiben muss, und übergeben Sie bei Bedarf ein Charakterbild als Referenz.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kostet jede Erweiterung extra?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja. Jede Erweiterung berechnet ihre eigenen 10 Sekunden Videoausgabe sowie die Eingabetokens für den gelesenen Kontext.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Was mache ich, wenn ich mehr als 40 Sekunden benötige?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Veo 3.1 erweitert Videos jeweils um sieben Sekunden auf bis zu 148 Sekunden, allerdings nur in 720p. Der &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash-vs-veo-3-1?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Modellvergleich&lt;/a&gt; erklärt den Kompromiss. Der &lt;a href="https://apidog.com/de/blog/veo-3-1-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Veo-3.1-API-Leitfaden&lt;/a&gt; enthält die Integrationsdetails.&lt;/p&gt;

&lt;h2&gt;
  
  
  Fazit
&lt;/h2&gt;

&lt;p&gt;Szenenerweiterung macht Omni von einer Demo zu einem nutzbaren Produktionswerkzeug – vorausgesetzt, Sie planen die Kette im Voraus:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Storyboarden Sie die vier Schlüsselmomente.&lt;/li&gt;
&lt;li&gt;Validieren Sie den gesamten Ablauf in 360p.&lt;/li&gt;
&lt;li&gt;Beschränken Sie jeden Erweiterungsprompt auf eine zentrale Bewegung.&lt;/li&gt;
&lt;li&gt;Definieren Sie Kontinuitätsanker für Charaktere und Kamera.&lt;/li&gt;
&lt;li&gt;Rendern Sie erst dann die funktionierende Version in 720p oder höher.&lt;/li&gt;
&lt;/ol&gt;

</description>
    </item>
    <item>
      <title>Gemini Omni kostenlos nutzen: So geht's (und wo es Einschränkungen gibt)</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Fri, 28 Aug 2026 08:28:10 +0000</pubDate>
      <link>https://dev.to/emree_demir/gemini-omni-kostenlos-nutzen-so-gehts-und-wo-es-einschrankungen-gibt-5c7j</link>
      <guid>https://dev.to/emree_demir/gemini-omni-kostenlos-nutzen-so-gehts-und-wo-es-einschrankungen-gibt-5c7j</guid>
      <description>&lt;h1&gt;
  
  
  Ist die Gemini Omni API kostenlos?
&lt;/h1&gt;

&lt;p&gt;Die Gemini Omni API ist nicht kostenlos. Es gibt keine kostenlose Stufe, keine Testguthaben und keine ratenbegrenzte Hobby-Spur. Jede über &lt;code&gt;gemini-omni-1.1-flash&lt;/code&gt; generierte Videosekunde wird ab der ersten Anfrage abgerechnet – bei 720p ungefähr mit 0,10 $ pro Sekunde.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Probieren Sie Apidog heute aus&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Das unterscheidet Omni vom Rest der Gemini-Familie. Die &lt;a href="https://apidog.com/de/blog/gemini-omni-1.1-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GA-Veröffentlichung&lt;/a&gt; brachte 40-sekündige Szenenerweiterungen, Keyframe-Steuerung und günstige 360p-Entwürfe – aber keine kostenlose API-Nutzung.&lt;/p&gt;

&lt;p&gt;Googles Textmodelle bieten über AI Studio eine ratenbegrenzte kostenlose Stufe. Für Video gilt das nicht.&lt;/p&gt;

&lt;p&gt;Es gibt trotzdem zwei Möglichkeiten, Gemini Omni kostenlos zu nutzen. Keine davon ist die API:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;YouTube Shorts und YouTube Create&lt;/li&gt;
&lt;li&gt;Das Studentenangebot von Google&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  Kostenloser Weg 1: YouTube Shorts und YouTube Create
&lt;/h2&gt;

&lt;p&gt;Als Google &lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-omni/" rel="noopener noreferrer"&gt;Gemini Omni vorstellte&lt;/a&gt;, wurde ein kostenloser Rollout für Nutzer von YouTube Shorts und der YouTube-Create-App angekündigt.&lt;/p&gt;

&lt;p&gt;In Shorts funktioniert das über Remix:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Wählen Sie ein geeignetes Short aus.&lt;/li&gt;
&lt;li&gt;Beschreiben Sie die gewünschte Änderung.&lt;/li&gt;
&lt;li&gt;Fügen Sie bei Bedarf sich selbst oder eine visuelle Referenz hinzu.&lt;/li&gt;
&lt;li&gt;Lassen Sie eine neue Version erzeugen.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Dafür benötigen Sie weder ein Abonnement noch eine Abrechnungseinrichtung oder einen API-Schlüssel.&lt;/p&gt;

&lt;h3&gt;
  
  
  Einschränkungen
&lt;/h3&gt;

&lt;p&gt;YouTube Create ist eine mobile App und bislang nur in einigen Ländern verfügbar. Prüfen Sie daher zuerst, ob die App in Ihrer Region angeboten wird.&lt;/p&gt;

&lt;p&gt;Außerdem handelt es sich um eine Consumer-Oberfläche:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;keine Skripte&lt;/li&gt;
&lt;li&gt;keine Batch-Verarbeitung&lt;/li&gt;
&lt;li&gt;keine Pipeline-Integration&lt;/li&gt;
&lt;li&gt;keine programmgesteuerte Parametersteuerung&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Dieser Weg eignet sich, um Omni auszuprobieren. Für ein Produkt oder einen automatisierten Workflow ist er nicht geeignet.&lt;/p&gt;

&lt;h2&gt;
  
  
  Kostenloser Weg 2: das Studentenangebot
&lt;/h2&gt;

&lt;p&gt;Berechtigte Studenten erhalten &lt;a href="https://blog.google/innovation-and-ai/products/gemini-app/student-offer-google-ai/" rel="noopener noreferrer"&gt;12 Monate lang einen Google AI Plan kostenlos&lt;/a&gt;. Außerhalb der USA ist dies Google AI Plus, in den USA Google AI Pro. Der Plan beinhaltet den Zugriff auf Gemini Omni.&lt;/p&gt;

&lt;p&gt;Vor der Anmeldung sollten Sie diese Bedingungen prüfen:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Sie müssen mindestens 18 Jahre alt, Student und Einwohner eines teilnehmenden Landes sein.&lt;/li&gt;
&lt;li&gt;Google überprüft den Studentenstatus über SheerID.&lt;/li&gt;
&lt;li&gt;Eine gültige Zahlungsmethode ist erforderlich.&lt;/li&gt;
&lt;li&gt;Das Angebot kann bis zum 31. Dezember 2026 eingelöst werden.&lt;/li&gt;
&lt;li&gt;Nach zwölf Monaten verlängert sich der Plan automatisch kostenpflichtig, sofern Sie nicht vorher kündigen.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die zwölf Monate sind also kostenlos, danach nicht mehr. Setzen Sie sich am besten direkt eine Erinnerung für den elften Monat.&lt;/p&gt;

&lt;p&gt;Der Zugang funktioniert innerhalb der Gemini App und in Google Flow. Einen API-Zugriff erhalten Sie auch mit diesem Angebot nicht.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was ist mit kostenlosen API-Guthaben?
&lt;/h2&gt;

&lt;p&gt;Die kostenlose Stufe der Gemini API gilt für Textmodelle. Gemini Omni und Veo sind nicht enthalten.&lt;/p&gt;

&lt;p&gt;Die &lt;a href="https://ai.google.dev/gemini-api/docs/pricing" rel="noopener noreferrer"&gt;Preisseite&lt;/a&gt; führt für Omni keine kostenlose Stufe auf. Auch die kostenlosen Ratenbegrenzungsstufen enthalten keine Videogenerierungsmodelle.&lt;/p&gt;

&lt;p&gt;Wenn Sie programmatisch auf Omni zugreifen möchten, müssen Sie die Abrechnung aktivieren. Die &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-omni-1.1-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Anleitung&lt;/a&gt; beschreibt die Einrichtung. Bereits die erste Testanfrage kostet Geld.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was die kostenpflichtigen Stufen bieten
&lt;/h2&gt;

&lt;p&gt;Für explorative Arbeiten kann ein Abonnement günstiger sein als die API: Sie zahlen eine feste monatliche Gebühr statt pro Videosekunde.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Oberfläche&lt;/th&gt;
&lt;th&gt;Zugang&lt;/th&gt;
&lt;th&gt;Kosten&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;YouTube Shorts Remix, YouTube Create&lt;/td&gt;
&lt;td&gt;Kostenlos&lt;/td&gt;
&lt;td&gt;0 $&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gemini App, Google Flow&lt;/td&gt;
&lt;td&gt;Google AI Plus, Pro oder Ultra&lt;/td&gt;
&lt;td&gt;Abonnement&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gemini API&lt;/td&gt;
&lt;td&gt;Abrechnung aktiviert&lt;/td&gt;
&lt;td&gt;ca. 0,10 $/Sek. bei 720p&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Google hat die Abonnementlimits bei der I/O 2026 auf ein rechenbasiertes Modell umgestellt. Das Kontingent wird alle fünf Stunden erneuert, bis ein wöchentliches Limit erreicht ist. Pro- und Ultra-Abonnenten können zusätzliche Guthaben erwerben.&lt;/p&gt;

&lt;p&gt;AI Ultra kostet je nach Stufe 100 oder 200 $ pro Monat. Da die Szenenerweiterung in der Gemini App ein Abonnement voraussetzt, benötigen Sie für den &lt;a href="https://apidog.com/de/blog/gemini-omni-scene-extension-40-seconds?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;40-Sekunden-Workflow&lt;/a&gt; einen entsprechenden Plan.&lt;/p&gt;

&lt;p&gt;Die Entscheidung ist einfach:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Kreativ erkunden:&lt;/strong&gt; Abonnement verwenden.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Produkt oder Automatisierung bauen:&lt;/strong&gt; API verwenden und pro Sekunde bezahlen.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Die günstigste Nutzung der API
&lt;/h2&gt;

&lt;p&gt;Da es keine kostenlose API-Stufe gibt, sollten Sie die ersten Experimente möglichst günstig durchführen.&lt;/p&gt;

&lt;h3&gt;
  
  
  In 360p entwerfen
&lt;/h3&gt;

&lt;p&gt;Omni erzeugt 360p zu einem Drittel der Kosten von 720p und bis zu 60 % schneller. Ein zehnsekündiger Clip kostet dadurch ungefähr 0,34 $ statt 1,01 $.&lt;/p&gt;

&lt;p&gt;In der Prompt-Entwicklungsphase sind viele Generierungen ohnehin verworfene Entwürfe. Die &lt;a href="https://apidog.com/de/blog/gemini-omni-1.1-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;vollständige Preisaufschlüsselung&lt;/a&gt; zeigt die Berechnung.&lt;/p&gt;

&lt;h3&gt;
  
  
  Drei weitere Maßnahmen
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Generierungen cachen:&lt;/strong&gt; Speichern Sie jede Ausgabedatei zusammen mit Prompt und Parametern. Einen identischen Clip erneut zu generieren, kostet unnötig etwa 0,10 $ pro Sekunde.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Client-Timeout erhöhen:&lt;/strong&gt; Videogenerierung dauert. Ein Timeout bedeutet nicht automatisch, dass die Generierung fehlgeschlagen ist. Eine automatische Wiederholung kann denselben Clip doppelt abrechnen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Abrechnungswarnung einrichten:&lt;/strong&gt; Aktivieren Sie die Warnung vor der ersten Anfrage, nicht erst nach der ersten unerwarteten Rechnung.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Das Speichern und Testen der Anfrage in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; unterstützt besonders beim Timeout-Problem. Legen Sie Timeout und erwartetes Antwortformat bewusst fest und halten Sie den API-Schlüssel in einer Umgebungsvariablen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was der kostenlose Zugang nicht kann
&lt;/h2&gt;

&lt;p&gt;Beide kostenlosen Wege haben dieselben grundlegenden Grenzen:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Kein API-Zugriff:&lt;/strong&gt; YouTube-Oberflächen und Abonnements bieten keinen Endpunkt für eigene Aufrufe.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Keine Automatisierung:&lt;/strong&gt; Die Generierung erfolgt manuell, Clip für Clip.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Keine vollständige Parameterkontrolle:&lt;/strong&gt; Auflösung, Seitenverhältnis und Ausgabeformat werden über API-Einstellungen gesteuert.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Wasserzeichen:&lt;/strong&gt; Jede Generierung trägt ein &lt;a href="https://deepmind.google/technologies/synthid/" rel="noopener noreferrer"&gt;SynthID&lt;/a&gt;-Wasserzeichen. Es ist für Betrachter unsichtbar, aber programmatisch erkennbar.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Wenn Sie nur prüfen möchten, ob Omni Ihr Problem löst, reicht der kostenlose Zugang. Wenn Sie eine Funktion ausliefern möchten, müssen Sie API-Kosten einplanen.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Ist Gemini Omni kostenlos?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
In YouTube Shorts und YouTube Create: ja. In der Gemini App und Google Flow benötigen Sie Google AI Plus, Pro oder Ultra. Über die API gibt es keine kostenlose Stufe.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Warum hat Gemini 3.6 Flash eine kostenlose Stufe, Omni aber nicht?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Videoausgabe wird mit 17,50 $ pro einer Million Tokens abgerechnet. Eine Sekunde 720p-Video entspricht 5.792 Tokens. Diese Kostenstruktur ist nicht mit einer Textvervollständigung vergleichbar. Die &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-for-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;kostenlose AI-Studio-Stufe&lt;/a&gt; deckt nur Textmodelle ab.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kann ich kostenlose API-Guthaben für Omni erhalten?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nicht über die kostenlose Stufe der Gemini API, da sie keine Videogenerierungsmodelle enthält.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Beinhaltet das Studentenangebot die API?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nein. Es gilt für den Google AI Plan und damit für Gemini App und Flow. API-Nutzung wird separat abgerechnet.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Was ist der günstigste Weg, Video über eine API zu generieren?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Im Google-Angebot kostet Veo 3.1 Lite bei 720p 0,05 $ pro Sekunde und damit weniger als Omni. Dafür fehlen 4K und die konversationelle Bearbeitung. Der &lt;a href="https://apidog.com/de/blog/gemini-omni-1.1-flash-vs-veo-3-1?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Modellvergleich&lt;/a&gt; beschreibt den Kompromiss. Die &lt;a href="https://apidog.com/de/blog/free-google-veo-3?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;kostenlosen Veo-Zugriffsmethoden&lt;/a&gt; sind die nächstgelegene Option für kostenlose Videogenerierung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Gibt es eine kostenlose Testversion der Gemini Omni API?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nein. Es werden keine Testguthaben angeboten. Die Abrechnung muss vor dem ersten Aufruf aktiviert werden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Fazit
&lt;/h2&gt;

&lt;p&gt;Google stellt Gemini Omni über YouTube kostenlos bereit, hält die API aber vollständig kostenpflichtig. Die kostenlosen Wege eignen sich zum Bewerten, nicht zum Aufbau automatisierter Produkte.&lt;/p&gt;

&lt;p&gt;Testen Sie Omni zunächst in Shorts, beginnen Sie bei API-Experimenten mit 360p und speichern Sie Ihre erste Anfrage mit einem angemessenen Timeout. &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Laden Sie Apidog herunter&lt;/a&gt;, damit Sie die Kosten jedes Aufrufs kontrollieren können, bevor die Rechnung eintrifft.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Gemini Omni 1.1 Flash vs. Veo 3.1: Welche Video-API sollten Sie nutzen?</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Fri, 28 Aug 2026 08:05:36 +0000</pubDate>
      <link>https://dev.to/emree_demir/gemini-omni-11-flash-vs-veo-31-welche-video-api-sollten-sie-nutzen-4hch</link>
      <guid>https://dev.to/emree_demir/gemini-omni-11-flash-vs-veo-31-welche-video-api-sollten-sie-nutzen-4hch</guid>
      <description>&lt;p&gt;Google bietet jetzt zwei generative Videomodelle unter demselben API-Schlüssel an. Sie sind keine Versionen voneinander: Veo 3.1 ist der filmische Renderer mit nativem Audio. Gemini Omni 1.1 Flash, &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;seit dem 27. August 2026 allgemein verfügbar&lt;/a&gt;, ist das konversationelle Modell für Bearbeitungen über mehrere Züge hinweg.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog heute ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Die Wahl hängt von drei Fragen ab: Benötigen Sie Audio? Müssen Sie einen Clip nach dem Ansehen iterieren? Wie lang soll das fertige Video sein?&lt;/p&gt;

&lt;h2&gt;
  
  
  Vergleichstabelle
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Gemini Omni 1.1 Flash&lt;/th&gt;
&lt;th&gt;Veo 3.1&lt;/th&gt;
&lt;/tr&gt;&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Modell-ID&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gemini-omni-1.1-flash&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;veo-3.1-generate-preview&lt;/code&gt; (plus schnelle und Lite-Varianten)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;API-Oberfläche&lt;/td&gt;
&lt;td&gt;Interactions API (&lt;code&gt;/v1beta/interactions&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;generateContent&lt;/code&gt;, langwierige Operation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Natives Audio&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;td&gt;Ja, immer aktiviert&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Basislänge des Clips&lt;/td&gt;
&lt;td&gt;10 Sekunden&lt;/td&gt;
&lt;td&gt;4, 6 oder 8 Sekunden&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Maximale Länge durch Erweiterung&lt;/td&gt;
&lt;td&gt;40 Sekunden, in 10-Sekunden-Schritten&lt;/td&gt;
&lt;td&gt;148 Sekunden, 7 Sekunden auf einmal, bis zu 20 Erweiterungen&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gelesener Kontext bei Erweiterung&lt;/td&gt;
&lt;td&gt;Bis zu 10 Sekunden des vorherigen Materials&lt;/td&gt;
&lt;td&gt;Nicht angegeben&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Konversationelle Bearbeitung&lt;/td&gt;
&lt;td&gt;Ja, über &lt;code&gt;previous_interaction_id&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Erster und letzter Frame&lt;/td&gt;
&lt;td&gt;Ja&lt;/td&gt;
&lt;td&gt;Ja, über &lt;code&gt;lastFrame&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Referenzmedien&lt;/td&gt;
&lt;td&gt;Bis zu 3 Videoclips von je 3 Sekunden&lt;/td&gt;
&lt;td&gt;Bis zu 3 Referenzbilder&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Auflösungen&lt;/td&gt;
&lt;td&gt;360p, 720p, 1080p, 4K&lt;/td&gt;
&lt;td&gt;720p, 1080p, 4K (720p nur bei Erweiterung)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Seitenverhältnisse&lt;/td&gt;
&lt;td&gt;16:9, 9:16&lt;/td&gt;
&lt;td&gt;16:9, 9:16&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;720p Kosten pro Sekunde&lt;/td&gt;
&lt;td&gt;~0,10 $&lt;/td&gt;
&lt;td&gt;0,40 $ Standard, 0,10 $ schnell, 0,05 $ Lite&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kostenlose Stufe&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Wasserzeichen&lt;/td&gt;
&lt;td&gt;SynthID&lt;/td&gt;
&lt;td&gt;SynthID&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  Wann Gemini Omni 1.1 Flash die bessere Wahl ist
&lt;/h2&gt;

&lt;p&gt;**Sie müssen einen Clip nach dem Ansehen ändern. neue Generierung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Sie wollen kostengünstig prototypisieren.&lt;/strong&gt; Omnis 360p-Stufe generiert bis zu 60 % schneller und kostet ein Drittel des 720p-Preises. Veos niedrigste Auflösung ist 720p. Nach zwölf Prompt-Versuchen macht sich der Unterschied bemerkbar; die &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisübersicht&lt;/a&gt; enthält die Details.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Ihre Referenzen sind Videos.&lt;/strong&gt; Omni akzeptiert bis zu drei Referenzclips mit jeweils drei Sekunden und kann deren Bewegungen auf eine neue Szene übertragen. Veo arbeitet mit Referenzbildern. Für konsistente Bewegungen oder Charaktere über mehrere Aufnahmen hinweg sind Videoreferenzen oft geeigneter.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Die Szene soll bei Erweiterungen konsistent bleiben.&lt;/strong&gt; Omni analysiert bis zu zehn Sekunden des vorherigen Materials. Der &lt;a href="https://apidog.com/de/blog/gemini-omni-scene-extension-40-seconds?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Leitfaden zur Szenenerweiterung&lt;/a&gt; zeigt, wie Sie damit bis zu 40 Sekunden erzeugen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Wann Veo 3.1 die bessere Wahl ist
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Sie benötigen Audio.&lt;/strong&gt; Veo generiert natives Audio zusammen mit dem Video. Omnis Dokumentation behandelt Videoausgabe und ignoriert Audio in Referenzclips. Wenn das Endergebnis Ton braucht, ist Veo die klare Wahl. Der &lt;a href="https://apidog.com/de/blog/veo-3-1-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Veo-3.1-API-Leitfaden&lt;/a&gt; beschreibt die Integration.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Der Clip muss länger als 40 Sekunden sein.&lt;/strong&gt; Veo erweitert jeweils um sieben Sekunden, bis zu 20-mal, und erreicht maximal 148 Sekunden. Omni ist auf 40 Sekunden begrenzt. Die erweiterte Veo-Ausgabe ist allerdings nur in 720p verfügbar.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Sie suchen die niedrigsten Kosten pro Sekunde.&lt;/strong&gt; Veo 3.1 Lite kostet bei 720p nur 0,05 $ pro Sekunde und damit die Hälfte von Omnis Rate. Dafür fehlt die 4K-Unterstützung. Für volumenreiche, risikoarme Generierung ist Lite die günstigste Option.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Sie brauchen einen kurzen Clip.&lt;/strong&gt; Veo erzeugt 4- oder 6-Sekunden-Clips. Omni erzeugt zehn Sekunden. Für einen benötigten 4-Sekunden-Schnitt zahlen Sie bei Veo also nur vier Sekunden, bei Omni zehn.&lt;/p&gt;

&lt;h2&gt;
  
  
  Die Entscheidung in vier Zeilen
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Audio erforderlich? &lt;strong&gt;Veo 3.1&lt;/strong&gt;
&lt;/li&gt;
&lt;li&gt;Mehr als 40 Sekunden erforderlich? &lt;strong&gt;Veo 3.1&lt;/strong&gt;
&lt;/li&gt;
&lt;li&gt;Bearbeitung nach dem Ansehen oder günstiges Prototyping? &lt;strong&gt;Omni 1.1 Flash&lt;/strong&gt;
&lt;/li&gt;
&lt;li&gt;Niedrigster Preis pro Sekunde, ohne weitere Anforderungen? &lt;strong&gt;Veo 3.1 Lite&lt;/strong&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Viele Pipelines verwenden beide Modelle: Omni für die konversationelle Entwicklung einer Einstellung und Veo für den finalen Render mit Audio. Beide Modelle verwenden denselben API-Schlüssel.&lt;/p&gt;

&lt;h2&gt;
  
  
  Zwei Integrationen statt einer
&lt;/h2&gt;

&lt;p&gt;Die Endpunkte sind strukturell unterschiedlich:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Omni:&lt;/strong&gt; POST an &lt;code&gt;/v1beta/interactions&lt;/code&gt;; das Modell steht im Request-Body. Videos werden inline als Base64 zurückgegeben. Überschreitet die Datei 4 MB, erhalten Sie stattdessen einen URI.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Veo:&lt;/strong&gt; &lt;code&gt;generateContent&lt;/code&gt; startet eine langwierige Operation, deren Status Sie abfragen müssen. Generierte Dateien bleiben zwei Tage auf Googles Servern und werden anschließend gelöscht.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Ein Wechsel zwischen den Modellen ist daher nicht mit einer Änderung des Modellstrings erledigt. Ihre Abstraktionsschicht muss sowohl abgefragte Operationen als auch zwei mögliche Antwortformen verarbeiten. Der &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-omni-1-1-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Omni-API-Walkthrough&lt;/a&gt; erklärt die Antwortverarbeitung.&lt;/p&gt;

&lt;p&gt;Legen Sie vor der Implementierung für jedes Modell eine gespeicherte Anfrage in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; an:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;API-Schlüssel als Umgebungsvariable speichern.&lt;/li&gt;
&lt;li&gt;Anfrage und Antwortstruktur prüfen.&lt;/li&gt;
&lt;li&gt;Timeouts deutlich über die Standardwerte erhöhen.&lt;/li&gt;
&lt;li&gt;Den gleichen Prompt über beide Modelle ausführen.&lt;/li&gt;
&lt;li&gt;Qualität, Laufzeit und Kosten vergleichen.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;So wird der Modellvergleich reproduzierbar, ohne später alte cURL-Befehle aus dem Gedächtnis rekonstruieren zu müssen.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Ist Gemini Omni ein Ersatz für Veo?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nein. Google bietet beide Modelle parallel an. Veo 3.1 ist nicht veraltet; beide Modelle lösen unterschiedliche Aufgaben.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Welches Modell ist günstiger?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Bei 720p liegen Omni und Veo 3.1 Fast mit etwa 0,10 $ pro Sekunde gleichauf. Veo 3.1 Lite ist mit 0,05 $ günstiger. Standard-Veo 3.1 kostet 0,40 $ pro Sekunde.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Können beide Modelle Videos mit Dialog erzeugen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Veo generiert natives Audio. Omnis Videoausgabe enthält keine Audiogenerierung. Beim Erweitern eines hochgeladenen Videos kann Omni keinen Dialog hinzufügen.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Haben beide Modelle ein Wasserzeichen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja. Beide verwenden &lt;a href="https://deepmind.google/technologies/synthid/" rel="noopener noreferrer"&gt;SynthID&lt;/a&gt;, das für Zuschauer unsichtbar, aber programmatisch erkennbar ist.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Was ist mit Sora oder anderen Video-APIs?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Andere Anbieter bieten andere Kompromisse. &lt;a href="https://apidog.com/de/blog/openai-sora-2?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;OpenAI Sora 2&lt;/a&gt; und &lt;a href="https://apidog.com/de/blog/seedance?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Seedance 1.0&lt;/a&gt; sind gute Vergleichspunkte außerhalb von Googles Angebot.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Mit welchem Modell sollte ich beginnen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Für Prototypen ohne Audio beginnen Sie mit Omni bei 360p. Das ist der günstigste Weg, die grundsätzliche Eignung von generiertem Video zu testen. &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Laden Sie Apidog herunter&lt;/a&gt; und speichern Sie Ihre erste Anfrage, damit spätere Vergleiche reproduzierbar bleiben.&lt;/p&gt;

&lt;p&gt;Die Kurzfassung: &lt;strong&gt;Veo rendert, Omni konversiert.&lt;/strong&gt; Googles &lt;a href="https://ai.google.dev/gemini-api/docs/video" rel="noopener noreferrer"&gt;Dokumentation zur Videogenerierung&lt;/a&gt; behandelt beide Modelle. Wählen Sie daher nach Aufgabe und nicht nach Team.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Gemini Omni 1.1 Flash Kosten: Was eine Sekunde Video tatsächlich kostet</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Fri, 28 Aug 2026 08:03:59 +0000</pubDate>
      <link>https://dev.to/emree_demir/gemini-omni-11-flash-kosten-was-eine-sekunde-video-tatsachlich-kostet-1jig</link>
      <guid>https://dev.to/emree_demir/gemini-omni-11-flash-kosten-was-eine-sekunde-video-tatsachlich-kostet-1jig</guid>
      <description>&lt;p&gt;Eine Sekunde 720p-Video mit Gemini Omni 1.1 Flash kostet etwa &lt;strong&gt;0,10 US-Dollar&lt;/strong&gt;. Das entspricht dem Wert auf Googles eigener &lt;a href="https://ai.google.dev/gemini-api/docs/pricing" rel="noopener noreferrer"&gt;Preisseite&lt;/a&gt;. Eine kostenlose API-Stufe gibt es nicht: Bereits der erste Clip, den Sie beim Lesen der Dokumentation generieren, wird Ihrem Konto berechnet.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog heute testen&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Der entscheidende Punkt: Google rechnet nicht nach Videodauer, sondern nach Tokens ab. Wer das Modell versteht, kann die größten Kostentreiber gezielt optimieren. Der wichtigste Hebel ist die Erstellung von Entwürfen in 360p – damit sinken die Iterationskosten um zwei Drittel.&lt;/p&gt;

&lt;h2&gt;
  
  
  Die Preisliste
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Posten&lt;/th&gt;
&lt;th&gt;Preis&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eingabe (Text, Bild, Video, Audio)&lt;/td&gt;
&lt;td&gt;1,50 $ pro 1 Million Tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Textausgabe&lt;/td&gt;
&lt;td&gt;9,00 $ pro 1 Million Tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Videoausgabe&lt;/td&gt;
&lt;td&gt;17,50 $ pro 1 Million Tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kostenlose Stufe&lt;/td&gt;
&lt;td&gt;Keine&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Die Preise gelten für &lt;code&gt;gemini-omni-1.1-flash&lt;/code&gt;, das am 27. August 2026 veröffentlichte GA-Modell, sowie für den auslaufenden Endpunkt &lt;code&gt;gemini-omni-flash-preview&lt;/code&gt;. Eine Übersicht der Funktionen finden Sie in &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Googles GA-Version von Gemini Omni 1.1 Flash&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  So wird Videoausgabe zu Tokens
&lt;/h2&gt;

&lt;p&gt;Google rechnet Video wie Text über Ausgabe-Tokens ab. Eine Sekunde 720p-Video entspricht &lt;strong&gt;5.792 Ausgabe-Tokens&lt;/strong&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;5.792 Tokens x ($17.50 / 1.000.000) = $0.1014 pro Sekunde
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Daraus ergeben sich ungefähr:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;10 Sekunden 720p:&lt;/strong&gt; 1,01 $&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;40 Sekunden:&lt;/strong&gt; 4,06 $ Ausgabegebühr bei einer Generierung plus drei Erweiterungen&lt;/li&gt;
&lt;li&gt;Zusätzlich fallen Eingabe-Tokens für den vorherigen Kontext jeder Erweiterungsrunde an.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die Eingabe ist mit 1,50 $ pro Million Tokens vergleichsweise günstig. Referenzbilder und -videos fallen gegenüber der Videoausgabe kaum ins Gewicht. Optimieren Sie deshalb nicht primär die Prompt-Länge, sondern die Anzahl der generierten Sekunden und die verwendete Auflösung.&lt;/p&gt;

&lt;h2&gt;
  
  
  Der 360p-Hebel
&lt;/h2&gt;

&lt;p&gt;360p-Vorschauen kosten ein Drittel von 720p und werden bis zu 60 % schneller erzeugt. Ein 10-sekündiger Entwurf kostet dadurch etwa 0,34 $ statt 1,01 $.&lt;/p&gt;

&lt;p&gt;Da Videoprompts selten beim ersten Versuch den gewünschten Shot liefern, summieren sich Iterationen schnell. Bei zwölf Versuchen ergibt sich:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Workflow&lt;/th&gt;
&lt;th&gt;12 Entwürfe&lt;/th&gt;
&lt;th&gt;1 finales Rendering&lt;/th&gt;
&lt;th&gt;Gesamt&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Alles in 720p&lt;/td&gt;
&lt;td&gt;12,17 $&lt;/td&gt;
&lt;td&gt;1,01 $&lt;/td&gt;
&lt;td&gt;13,18 $&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entwürfe in 360p, Finale in 720p&lt;/td&gt;
&lt;td&gt;4,06 $&lt;/td&gt;
&lt;td&gt;1,01 $&lt;/td&gt;
&lt;td&gt;5,07 $&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Das ist dieselbe Ausgabe mit &lt;strong&gt;62 % weniger Kosten&lt;/strong&gt; – und die Entwürfe sind schneller verfügbar.&lt;/p&gt;

&lt;p&gt;Setzen Sie während der Iteration &lt;code&gt;resolution&lt;/code&gt; in &lt;code&gt;response_format&lt;/code&gt; auf &lt;code&gt;360p&lt;/code&gt;. Erhöhen Sie die Auflösung erst, wenn der Prompt stimmt. Der &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-omni-1-1-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden für Gemini Omni 1.1 Flash&lt;/a&gt; zeigt die passende Anfrageform.&lt;/p&gt;

&lt;p&gt;1080p und 4K sind Upscales der generierten Frames, keine nativen Renderings. Sie werden über dem 720p-Tarif abgerechnet. Prüfen Sie vor der Planung einer 4K-Pipeline die aktuellen Kosten pro Sekunde auf Googles Preisseite, da diese Stufen mit der GA-Version eingeführt wurden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was der Erweiterungs-Workflow kostet
&lt;/h2&gt;

&lt;p&gt;Ein 40-sekündiges Video ist keine einzelne Anfrage: Es besteht aus einer Generierung und drei Erweiterungsaufrufen. Jeder Aufruf erzeugt eigene 10 Sekunden Ausgabe und liest den vorherigen Kontext als Eingabe.&lt;/p&gt;

&lt;p&gt;In 720p kostet eine vollständige 40-sekündige Szene etwa 4,06 $ an Ausgabe. Weicht ein Versuch von der gewünschten Geschichte ab, muss ab dem unterbrochenen Segment neu generiert werden.&lt;/p&gt;

&lt;p&gt;Ein effizienter Ablauf:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Erstellen Sie alle vier Segmente zunächst in 360p – für etwa 1,35 $.&lt;/li&gt;
&lt;li&gt;Prüfen Sie, ob die Geschichte durchgehend stimmt.&lt;/li&gt;
&lt;li&gt;Rendern Sie erst danach die finale Version in 720p.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Der &lt;a href="https://apidog.com/de/blog/gemini-omni-scene-extension-40-seconds?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Leitfaden zur Erweiterung von 40-sekündigen Szenen&lt;/a&gt; zeigt typische Fehlerstellen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Vergleich mit Veo 3.1
&lt;/h2&gt;

&lt;p&gt;Beide Modelle werden über denselben Gemini-API-Schlüssel abgerechnet. Dadurch kann der Preisunterschied leicht übersehen werden.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Modell&lt;/th&gt;
&lt;th&gt;720p pro Sekunde&lt;/th&gt;
&lt;th&gt;4K pro Sekunde&lt;/th&gt;
&lt;th&gt;Kostenlose Stufe&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gemini Omni 1.1 Flash&lt;/td&gt;
&lt;td&gt;ca. 0,10 $&lt;/td&gt;
&lt;td&gt;Upscale-Stufe, siehe Preisseite&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Veo 3.1&lt;/td&gt;
&lt;td&gt;0,40 $&lt;/td&gt;
&lt;td&gt;0,60 $&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Veo 3.1 Fast&lt;/td&gt;
&lt;td&gt;0,10 $&lt;/td&gt;
&lt;td&gt;0,30 $&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Veo 3.1 Lite&lt;/td&gt;
&lt;td&gt;0,05 $&lt;/td&gt;
&lt;td&gt;Nicht verfügbar&lt;/td&gt;
&lt;td&gt;Nein&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Standard-Veo 3.1 kostet pro 720p-Sekunde etwa viermal so viel wie Omni. Veo 3.1 Lite ist günstiger als Omni. Der Preis pro Sekunde ist jedoch nicht der einzige Entscheidungsfaktor:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Veo&lt;/strong&gt; erzeugt natives Audio und unterstützt längere Erweiterungen – sieben Sekunden pro Aufruf und bis zu 148 Sekunden insgesamt.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Omni&lt;/strong&gt; bietet eine konversationelle Bearbeitungsschleife, für die Veo kein gleichwertiges Gegenstück hat.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Der &lt;a href="https://apidog.com/de/blog/gemini-omni-1-1-flash-vs-veo-3-1?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;vollständige Vergleich von Gemini Omni 1.1 Flash und Veo 3.1&lt;/a&gt; hilft bei der Modellauswahl. Wer bereits Veo einsetzt, kann weiterhin den &lt;a href="https://apidog.com/de/blog/veo-3-1-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Veo-3.1-Integrationsleitfaden&lt;/a&gt; verwenden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Drei typische Kostenfallen
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;1. Kleine Änderungen in voller Auflösung prüfen&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Wenn Sie nur eine Klausel im Prompt ändern, reicht ein 360p-Durchlauf aus. Verwenden Sie 720p für die Version, die Sie tatsächlich ausliefern.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2. Wiederverwendbare Inhalte nicht cachen&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Die Videoausgabe ist ausreichend deterministisch, um sie wiederzuverwenden. Speichern Sie die generierte Datei zusammen mit Prompt und Parametern. Bei 0,10 $ pro Sekunde amortisiert sich Caching sofort.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3. Nach einem Timeout blind wiederholen&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Ein Client-Timeout bedeutet nicht automatisch, dass die Generierung fehlgeschlagen ist. Prüfen Sie vor einem Retry, ob die Interaktion bereits abgeschlossen wurde, und setzen Sie ein realistisches Timeout. Andernfalls können Sie denselben Clip zweimal bezahlen.&lt;/p&gt;

&lt;p&gt;Speichern Sie die Anfrage in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, prüfen Sie die Antwortform und führen Sie sie bewusst aus, statt eine Wiederholungsschleife über die Kosten entscheiden zu lassen. Richten Sie zusätzlich eine Ausgabenwarnung in der Google-Cloud-Abrechnung ein.&lt;/p&gt;

&lt;h2&gt;
  
  
  Monatliche Kosten schätzen
&lt;/h2&gt;

&lt;p&gt;Starten Sie mit den Sekunden des fertigen Videos und addieren Sie die Entwurfskosten:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;monatliche Kosten = fertige_Sekunden x $0.10
             + entwurfs_Sekunden x $0.034
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Beispiel: Ein Team liefert monatlich fünf Minuten fertiges 720p-Video und arbeitet mit einem Entwurfs-zu-Finale-Verhältnis von 10:1 in 360p:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;300 fertige Sekunden x $0.10       = $30.00
3.000 entwurfs Sekunden x $0.034   = $102.00
                                    -------
                                     $132.00
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Die Entwürfe dominieren die Rechnung: Sie kosten zwar nur ein Drittel pro Sekunde, umfassen aber zehnmal mehr Material als die finale Ausgabe. Wenn das Budget sinken soll, liegt der größte Hebel daher in weniger Versuchen pro erfolgreichem Ergebnis – etwa durch bessere Prompts und Keyframe-Steuerung – und nicht in einem günstigeren finalen Rendering.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Ist Gemini Omni 1.1 Flash kostenlos?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nicht über die API. Für Omni gibt es keine kostenlose API-Stufe. Auf YouTube Shorts und YouTube Create ist das Modell kostenlos verfügbar; die &lt;a href="https://apidog.com/de/blog/how-to-use-gemini-omni-for-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Übersicht zum kostenlosen Zugang&lt;/a&gt; beschreibt diese Optionen. Googles Textmodelle wie &lt;a href="https://apidog.com/de/blog/gemini-3-6-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Gemini 3.6 Flash&lt;/a&gt; bieten über AI Studio weiterhin eine ratenbegrenzte kostenlose Nutzung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wie viel kostet ein 10-sekündiges Video?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Etwa 1,01 $ in 720p oder 0,34 $ in 360p.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Warum wird Video in Tokens abgerechnet?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Google bepreist alle Modellausgaben in Tokens. Eine Sekunde 720p-Video entspricht 5.792 Tokens und wird mit 17,50 $ pro Million Video-Ausgabe-Tokens abgerechnet.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kosten Eingabebilder und Referenzclips extra?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja. Sie kosten 1,50 $ pro Million Eingabe-Tokens, sind gegenüber der Videoausgabe aber vergleichsweise günstig.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Lohnt sich 4K?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nur für finale Lieferobjekte. 1080p und 4K sind Upscales und fügen keine Details hinzu, die das Modell nicht bereits generiert hat. Sie erhöhen Dateigröße und Kosten.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wird eine fehlgeschlagene Generierung trotzdem abgerechnet?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Eine Generierung, die Video zurückgibt, wird abgerechnet. Inhaltsfilter-Ablehnungen und Fehler ohne Ausgabe sollten nicht berechnet werden. Prüfen Sie trotzdem in der ersten Woche jeder neuen Pipeline das Abrechnungs-Dashboard.&lt;/p&gt;

&lt;p&gt;Die Wirtschaftlichkeit belohnt Disziplin: günstig entwerfen, aggressiv cachen, Timeouts begrenzen und pro Aufgabentyp eine gespeicherte Anfrage aufbewahren. So erkennen Sie, wenn ein Modell-Update den Gegenwert Ihrer 0,10 $ verändert. &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog herunterladen&lt;/a&gt;, um diese Überprüfung vor der ersten Rechnung durchzuführen.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>APIDOG August-Updates: GitHub Enterprise Cloud, Stärkere SSO-Governance und mehr auditierbare Admin-APIs</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 10:33:55 +0000</pubDate>
      <link>https://dev.to/emree_demir/apidog-august-updates-github-enterprise-cloud-starkere-sso-governance-und-mehr-auditierbare-293i</link>
      <guid>https://dev.to/emree_demir/apidog-august-updates-github-enterprise-cloud-starkere-sso-governance-und-mehr-auditierbare-293i</guid>
      <description>&lt;h1&gt;
  
  
  Apidog August-Updates 2026: Git, SSO und auditierbare Administration
&lt;/h1&gt;

&lt;p&gt;Die vier öffentlichen Releases Apidog 2.8.41 bis 2.8.44 stärken drei zentrale Bereiche des Unternehmens-API-Betriebs: kontrollierte Git-Konnektivität, identitätsgesteuerten Projektzugriff und nachvollziehbare API-basierte Administration.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog heute ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Für API-Teams bedeutet das: Repositories, Identitäten und Mitgliedschaften lassen sich besser mit externen Unternehmenssystemen verbinden. Zusätzlich verbessern die Releases Projekterstellung, Importe, Branches, Dokumentation, CLI-Workflows und Testausführung.&lt;/p&gt;

&lt;h2&gt;
  
  
  Die wichtigsten Updates
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;GitHub Enterprise Cloud:&lt;/strong&gt; Unterstützung für Data-Residency-Deployments auf dedizierten &lt;code&gt;*.ghe.com&lt;/code&gt;-Domains.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;SSO und Projektzugriff:&lt;/strong&gt; SSO-Sitzungen bleiben auf die Organisationsarbeit fokussiert; SAML-Gruppenmapping initialisiert Projektberechtigungen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Administrations-APIs:&lt;/strong&gt; Nützlichere Mitgliederdaten, automatisiertes Team-Onboarding und Audit-Einträge für unterstützte API-Operationen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Zuverlässigkeit:&lt;/strong&gt; Korrekturen für Branches, OpenAPI-Importe und -Exporte, Dokumentation, CLI-Daten und Testausführung.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  1. GitHub Enterprise Cloud für Data-Residency-Workflows
&lt;/h2&gt;

&lt;p&gt;Unternehmen mit GitHub Enterprise Cloud Data Residency hosten Repositories auf dedizierten &lt;code&gt;*.ghe.com&lt;/code&gt;-Domains statt auf &lt;code&gt;github.com&lt;/code&gt;. Apidog kann nun mit dem Enterprise-Host der Organisation verbunden werden.&lt;/p&gt;

&lt;p&gt;Administratoren konfigurieren:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;den GitHub-Enterprise-Host,&lt;/li&gt;
&lt;li&gt;die OAuth App Client ID,&lt;/li&gt;
&lt;li&gt;das OAuth App Client Secret.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Der Autorisierungsfluss verwendet anschließend den konfigurierten Enterprise-Host. Dadurch kann Apidog auf die für unterstützte Git-Operationen erforderlichen Organisationen, Repositories, Branches und Dateien zugreifen.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F08%2Fgithub-enterprise-cloud-connection.png%3Futm_source%3Ddev.to%26utm_medium%3Dwanda%26utm_content%3Dn8n-post-automation" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F08%2Fgithub-enterprise-cloud-connection.png%3Futm_source%3Ddev.to%26utm_medium%3Dwanda%26utm_content%3Dn8n-post-automation" alt="Apidog GitHub Enterprise Cloud-Verbindung für Data-Residency-Workflows" width="760" height="472"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Unterstützte Workflows:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Git-Verbindung:&lt;/strong&gt; API-Definitionen im kontrollierten Repository und Branch bearbeiten.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Repository-Import:&lt;/strong&gt; OpenAPI- oder Swagger-Dateien aus einem Unternehmens-Repository importieren.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;OpenAPI-Backup:&lt;/strong&gt; API-Definitionen in einem ausgewählten Repository und Branch sichern.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;So bleiben Repository-Governance und Data-Residency-Modell der Organisation erhalten.&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Geltungsbereich:&lt;/strong&gt; Unterstützt werden GitHub Enterprise Cloud Data-Residency-Deployments auf dedizierten &lt;code&gt;*.ghe.com&lt;/code&gt;-SaaS-Domains. Eine allgemeine Unterstützung selbst gehosteter GitHub Enterprise Server-Domains ist nicht enthalten.&lt;/p&gt;
&lt;/blockquote&gt;

&lt;p&gt;Details: &lt;a href="https://docs.apidog.com/github-enterprise-cloud-2305226m0?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GitHub Enterprise Cloud&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  2. SSO-Governance und Projektzugriff verbessern
&lt;/h2&gt;

&lt;p&gt;Unternehmens-SSO soll nicht nur Benutzer authentifizieren, sondern auch den Zugriff auf den vorgesehenen Organisationsbereich steuern.&lt;/p&gt;

&lt;h3&gt;
  
  
  SSO-Sitzungen auf die Organisation beschränken
&lt;/h3&gt;

&lt;p&gt;Mit aktivierter SSO-Sitzungsisolation reduziert Apidog Einstiegspunkte in persönliche Teams und Projekte. Bestimmte Aktionen, mit denen Organisationsarbeit in persönliche Bereiche verschoben, kopiert oder geklont werden könnte, werden ebenfalls eingeschränkt.&lt;/p&gt;

&lt;p&gt;Benutzer bleiben damit auf die Organisation und das Team fokussiert, die mit ihrer SSO-Sitzung verbunden sind. Organisationen ohne aktivierte SSO-Sitzungsisolation behalten ihr bisheriges Verhalten.&lt;/p&gt;

&lt;p&gt;Mehr dazu: &lt;a href="https://docs.apidog.com/sso-overview-616325m0?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;SSO-Governance und Projektzugriff&lt;/a&gt;&lt;/p&gt;

&lt;h3&gt;
  
  
  SAML-Gruppenmapping bis auf Projektebene
&lt;/h3&gt;

&lt;p&gt;SAML-Gruppenmapping synchronisiert jetzt nicht nur Organisationen und Teams, sondern initialisiert auch den Zugriff auf bestehende Projekte unter dem synchronisierten Team:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Synchronisierte Teamrolle&lt;/th&gt;
&lt;th&gt;Initialer Projektzugriff&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Team-Administrator&lt;/td&gt;
&lt;td&gt;Bearbeiter&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Anderes Teammitglied&lt;/td&gt;
&lt;td&gt;Nur-Lesezugriff&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Wird ein zugeordneter Benutzer aus dem Team entfernt, synchronisiert Apidog auch die entsprechende Projektmitgliedschaft. Damit werden Identitätsanbietergruppen, Teamrollen und Projektberechtigungen konsistent miteinander verbunden.&lt;/p&gt;

&lt;p&gt;Details: &lt;a href="https://docs.apidog.com/mapping-groups-to-teams-741932m0?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Team-Mitgliedschaft auf Projektebene übertragen&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  3. Unternehmens-Administrations-APIs ausbauen
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Nützlichere Organisationsmitgliederdaten
&lt;/h3&gt;

&lt;p&gt;Die Organisationsmitglieder-API liefert nun zusätzlich E-Mail-Adressen und zuverlässigere Mitgliedernamen:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;GET /v1/organizations/{organizationId}/members
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Wenn kein Spitzname vorhanden ist, verwendet Apidog andere verfügbare Profilinformationen für den Namen. Fehlt eine E-Mail-Adresse, wird explizit &lt;code&gt;null&lt;/code&gt; zurückgegeben – auch bei anwendbaren ausstehenden oder bereitgestellten Datensätzen.&lt;/p&gt;

&lt;p&gt;Das vereinfacht:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Mitgliederinventare,&lt;/li&gt;
&lt;li&gt;automatisierte Synchronisation mit Identitäts- und Administrationssystemen,&lt;/li&gt;
&lt;li&gt;Zugriffsprüfungen ohne separaten CSV-Export.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Teamrollen zuweisen und Projektzugriff initialisieren
&lt;/h3&gt;

&lt;p&gt;Administratoren können Benutzer per E-Mail zu Teams hinzufügen und eine integrierte Teamrolle zuweisen:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;POST /v1/team-access-grants
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Jede Anfrage legt explizit fest:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;die Teamrolle: &lt;strong&gt;Administrator&lt;/strong&gt;, &lt;strong&gt;Mitglied&lt;/strong&gt; oder &lt;strong&gt;Gast&lt;/strong&gt;;&lt;/li&gt;
&lt;li&gt;die Initialisierung des Zugriffs auf bestehende Teamprojekte.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Mit &lt;code&gt;mapped&lt;/code&gt; initialisiert Apidog fehlende Projektberechtigungen gemäß der Teamrolle und behält bestehende gültige Projektrollen bei. Mit &lt;code&gt;none&lt;/code&gt; tritt der Benutzer dem Team ohne Projektmitgliedschaftsrechte bei.&lt;/p&gt;

&lt;p&gt;Der Endpunkt unterstützt außerdem:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Einladungen für Benutzer, die der Organisation noch nicht beigetreten sind;&lt;/li&gt;
&lt;li&gt;die Wiederherstellung früherer Teammitglieder;&lt;/li&gt;
&lt;li&gt;sichere wiederholte Aufrufe in automatisierten Onboarding-Workflows.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Aktive oder ausstehende Teammitglieder sowie Team Owner sind vor unbeabsichtigten Änderungen geschützt.&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Geltungsbereich:&lt;/strong&gt; Die Initialisierung gilt nur für Projekte, die beim ersten Beitritt oder bei der Wiederherstellung bereits unter dem Team existieren. Es gibt keine kontinuierliche Synchronisation und keine automatische Anwendung auf zukünftige Projekte. Team Owner, Billing Manager und benutzerdefinierte Teamrollen können mit diesem Endpunkt nicht zugewiesen werden.&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h3&gt;
  
  
  Unterstützte API-Administration im Audit-Trail
&lt;/h3&gt;

&lt;p&gt;Unterstützte externe administrative API-Operationen, die bestehenden Audit-Events entsprechen, werden jetzt im Audit-Trail erfasst. Governance-Teams erhalten dadurch eine konsistentere Sicht auf Aktionen aus der Apidog-Oberfläche und aus Automatisierungen.&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Geltungsbereich:&lt;/strong&gt; Die Audit-Abdeckung gilt nur für unterstützte externe API-Operationen mit bestehenden Audit-Events. Sie ist keine universelle Protokollierung jeder API-Anfrage oder jedes Management-Endpunkts.&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  Weitere Verbesserungen
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Unternehmens- und Umgebungsmanagement
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Organisationsmitgliedschaft:&lt;/strong&gt; Zugriff kann auf Mitglieder mit bestimmten E-Mail-Adressen beschränkt werden.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Einladungs-Belohnungen:&lt;/strong&gt; Kreditbelohnungen und zugehörige Einladungs-E-Mails lassen sich für Organisationen, Teams und Projekte deaktivieren.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Modulnavigation:&lt;/strong&gt; Bei mehr als fünf Modulen werden weitere Einträge automatisch eingeklappt; die Suche erleichtert das Auffinden einer Dienstkonfiguration.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;System-E-Mails:&lt;/strong&gt; E-Mails folgen der Sprache des Empfängers. Englisch wird verwendet, wenn keine Apidog-Sprachpräferenz verfügbar ist.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Organisationseigene Teams:&lt;/strong&gt; Organisationsinhaber und -administratoren können Team Owner und deren Status anzeigen, danach suchen und filtern sowie die Inhaberschaft für ein oder mehrere Teams übertragen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Projektmitglieder:&lt;/strong&gt; Massenbearbeitung, Mitgliederdialoge und Berechtigungseinstellungen wurden vereinfacht. Team-Owner-Rollen sind vor nicht unterstützten Änderungen geschützt.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Administrationsseiten:&lt;/strong&gt; Einheitlichere Layouts, Hilfelinks und eine verbesserte Upgrade-Darstellung erleichtern die Navigation in Unternehmens-Einstellungen, Richtlinien, Audit-Logs, Secret Scanner und SAML SSO. Die bestehende Berechtigungslogik bleibt unverändert.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Details: &lt;a href="https://docs.apidog.com/enterprise-policies-2294411m0?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Organisationsmitgliedschaftsrichtlinie&lt;/a&gt; · &lt;a href="https://docs.apidog.com/managing-teams-in-organization?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Organisationseigene Teams verwalten&lt;/a&gt;&lt;/p&gt;

&lt;h3&gt;
  
  
  Projekteinrichtung, Importe und Spezifikationen
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Beim Wechsel zwischen &lt;strong&gt;General Mode&lt;/strong&gt; und &lt;strong&gt;Spec Mode&lt;/strong&gt; bleiben bereits eingegebene Projektdaten erhalten.&lt;/li&gt;
&lt;li&gt;Postman-Importe unterstützen globale Variablen und bereinigen Leerzeichen in Variablennamen automatisch.&lt;/li&gt;
&lt;li&gt;Endpoint-Vorschauen können unterstützte Request-Bodies, Schemas und Responses aus separaten OpenAPI-Dateien über Cross-File-&lt;code&gt;$ref&lt;/code&gt; auflösen.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Nicht enthalten sind Spectral Lint über referenzierte Dateien, vollständige Endpoint-Referenzen und Cross-File-Referenzen im Form Mode.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bemerkenswerte Fehlerbehebungen
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Branches, Importe, Exporte und Codegenerierung
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Apidog-CLI-OpenAPI-Importe schreiben in den ausgewählten Branch statt versehentlich in den Main-Branch.&lt;/li&gt;
&lt;li&gt;Release-Dokumente aus Sub-Branches enthalten keine Endpunkte aus fremden Modulen oder leeren Ordnern mehr.&lt;/li&gt;
&lt;li&gt;Multi-Branch-Merges übertragen Endpunkte, Testszenarien und andere Ressourcen zuverlässiger.&lt;/li&gt;
&lt;li&gt;Die Aktion zum Erstellen einer Git-Repository-Verbindung reagiert beim OpenAPI-Import korrekt.&lt;/li&gt;
&lt;li&gt;OpenAPI- und CLI-Exporte berücksichtigen ausgewählte Module, Tags und Ordner.&lt;/li&gt;
&lt;li&gt;Modulübergreifend referenzierte Schemas bleiben bei der Codegenerierung zuverlässiger erhalten.&lt;/li&gt;
&lt;li&gt;Mit &lt;code&gt;AND&lt;/code&gt; verknüpfte Sicherheitsschemata werden korrekt exportiert.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Validierung und geteilte Dokumentation
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Strict-Mode-Antwortvalidierung unterstützt mit &lt;code&gt;allOf&lt;/code&gt; zusammengesetzte Schemas korrekt.&lt;/li&gt;
&lt;li&gt;Über zusätzliche Eigenschaften referenzierte Schemas erscheinen in der geteilten API-Dokumentation.&lt;/li&gt;
&lt;li&gt;Standardbeispiele werden in der geteilten Dokumentation korrekt angezeigt.&lt;/li&gt;
&lt;li&gt;Markdown-Dokumenttabs werden für abgemeldete Benutzer in öffentlichen Projekten vollständig gerendert.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  CLI-Daten und Testausführung
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Über KI oder Apidog CLI erstellte globale Variablen erzeugen keine leeren clientseitigen Variablennamen mehr.&lt;/li&gt;
&lt;li&gt;Ungültige, über Apidog CLI erstellte Tag-Werte verursachen keine Frontend-Zugriffsfehler mehr.&lt;/li&gt;
&lt;li&gt;Testdaten auf Projektebene bleiben ohne &lt;code&gt;--scenario&lt;/code&gt; in der Datenliste sichtbar.&lt;/li&gt;
&lt;li&gt;Prä- und Post-Prozessoren zeigen Ausführungsdetails während einer laufenden SSE-Anfrage in der Konsole.&lt;/li&gt;
&lt;li&gt;Dataset-Namen bleiben bei Langtext-Dataset-Variablen in Testläufen sichtbar.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Was diese Releases für Unternehmen bedeuten
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Fokus&lt;/th&gt;
&lt;th&gt;Verbesserung&lt;/th&gt;
&lt;th&gt;Nutzen&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Gesteuerte Git-Konnektivität&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Verbindung zu GitHub-Enterprise-Cloud-Data-Residency-Hosts auf &lt;code&gt;*.ghe.com&lt;/code&gt; für Git, Repository-Import und OpenAPI-Backup&lt;/td&gt;
&lt;td&gt;Repositories und Branch-Strukturen bleiben unter der Kontrolle der Organisation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Identität zu Projektzugriff&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;SSO-Sitzungsisolation und SAML-Gruppenmapping bis auf Projektebene&lt;/td&gt;
&lt;td&gt;Vorhersehbareres Onboarding und Offboarding mit weniger manueller Berechtigungsarbeit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Auditierbare Administration&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Reichere Mitgliederdaten, geschütztes Team-Onboarding per API und Audit-Events für unterstützte externe Operationen&lt;/td&gt;
&lt;td&gt;Mehr Automatisierung ohne Verlust von Governance und Nachvollziehbarkeit&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Zusammen mit den Verbesserungen an Umgebung, Richtlinien, Spezifikationen und Zuverlässigkeit verfolgen die Releases eine klare Richtung: Repository-Governance, Identitätszugriff und administrative Automatisierung sollen auch bei wachsenden Unternehmens-API-Programmen zusammenpassen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Community und Release Notes
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;a href="https://discord.com/invite/ZBxrzyXfbJ?ref=apidog.com" rel="noopener noreferrer"&gt;Discord-Community&lt;/a&gt; für Diskussionen und Support&lt;/li&gt;
&lt;li&gt;
&lt;a href="https://join.slack.com/t/apidogcommunity/shared_invite/zt-2neie4nh2-4_zhufuNBmCq4EtI6fZUwA?ref=apidog.com" rel="noopener noreferrer"&gt;Slack-Community&lt;/a&gt; für technische Gespräche&lt;/li&gt;
&lt;li&gt;&lt;a href="https://x.com/ApidogHQ?ref=apidog.com" rel="noopener noreferrer"&gt;Apidog auf X&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.linkedin.com/company/apidog/" rel="noopener noreferrer"&gt;Apidog auf LinkedIn&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://apidog.com/changelog?ref=apidog.com&amp;amp;utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog Changelog&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://apidog.com/changelog/2.8.41?ref=apidog.com&amp;amp;utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Version 2.8.41&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://apidog.com/changelog/2.8.42?ref=apidog.com&amp;amp;utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Version 2.8.42&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://apidog.com/changelog/2.8.43?ref=apidog.com&amp;amp;utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Version 2.8.43&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://apidog.com/changelog/2.8.44?ref=apidog.com&amp;amp;utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Version 2.8.44&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Mit freundlichen Grüßen&lt;br&gt;&lt;br&gt;
Das Apidog-Team&lt;/p&gt;

</description>
    </item>
    <item>
      <title>GLM-5.3-Flash Vision: Bilder an ein 1M-Kontext-Modell senden</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:37:01 +0000</pubDate>
      <link>https://dev.to/emree_demir/glm-53-flash-vision-bilder-an-ein-1m-kontext-modell-senden-aa6</link>
      <guid>https://dev.to/emree_demir/glm-53-flash-vision-bilder-an-ein-1m-kontext-modell-senden-aa6</guid>
      <description>&lt;p&gt;Die meisten Vision-Modelle zwingen Sie zur Wahl: Bild oder viel Text. GLM-5.3-Flash kombiniert native Bildeingabe mit einem Kontextfenster von 1.048.576 Tokens in derselben Anfrage und ermöglicht damit multimodale Workflows, die beides gleichzeitig benötigen.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog noch heute ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Dieser Leitfaden zeigt die Nutzlast, sinnvolle Workflows, Grenzen und Kosten.&lt;/p&gt;

&lt;h2&gt;
  
  
  Nativ statt adapterbasiert
&lt;/h2&gt;

&lt;p&gt;Frühere Vision-Modelle von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;, etwa GLM-5V-Turbo und GLM-4.6V, waren separate Endpunkte mit eigenen Modell-IDs. GLM-5.3 verarbeitet Vision über Adapter.&lt;/p&gt;

&lt;p&gt;GLM-5.3-Flash verarbeitet Bilder dagegen nativ: im selben Modell, Aufruf und Kontext wie Text. Das bedeutet eine Modell-ID, Abrechnung, Ratenbegrenzung und einen gemeinsamen Kontext für Bild und Text.&lt;/p&gt;

&lt;p&gt;Für ältere Modelle siehe den &lt;a href="https://apidog.com/de/blog/glm-5v-turbo-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5V-Turbo API-Leitfaden&lt;/a&gt; und den &lt;a href="https://apidog.com/de/blog/glm-4-6v-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-4.6V-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Die Nutzlast
&lt;/h2&gt;

&lt;p&gt;Bilder werden als typisierte Inhaltsblöcke gesendet. &lt;code&gt;content&lt;/code&gt; ist deshalb ein Array statt eines Strings:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;REDACTED&lt;/span&gt; &lt;span class="n"&gt;CREDENTIAL&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.z.ai/api/paas/v4/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;What is wrong with this layout on mobile?&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://example.com/mobile-view.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;},&lt;/span&gt;
            &lt;span class="p"&gt;],&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Für lokale oder private Bilder verwenden Sie eine Base64-Daten-URL:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;pathlib&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;Path&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="nb"&gt;str&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;-&amp;gt;&lt;/span&gt; &lt;span class="nb"&gt;dict&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;data&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;b64encode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nc"&gt;Path&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;read_bytes&lt;/span&gt;&lt;span class="p"&gt;()).&lt;/span&gt;&lt;span class="nf"&gt;decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;suffix&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;Path&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="n"&gt;suffix&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;lstrip&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;replace&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;jpg&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;jpeg&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data:image/&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;suffix&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;;base64,&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;data&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;}&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Für mehrere Bilder benötigen Sie mehrere Blöcke:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Image 1 is the design. Image 2 is what we built. List the differences.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;design.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
    &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;built.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Die Reihenfolge zählt. Platzieren Sie erklärenden Text vor dem jeweiligen Bild und beschriften Sie mehrere Bilder explizit, damit das Modell Referenzen zuverlässig zuordnen kann.&lt;/p&gt;

&lt;p&gt;Grundlagen zu Einrichtung und Authentifizierung finden Sie im &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lohnenswerte Workflows
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Screenshot-Debugging
&lt;/h3&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; beschreibt den Einsatz für Schnittstellen, Rendering-Ergebnisse und Interaktions-Feedback. Senden Sie fehlerhaftes Rendering und Quellcode zusammen:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;This component renders incorrectly below 400px. Here is the screenshot and the source.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;bug-mobile.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;```
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;endraw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
jsx&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;component_source&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="s"&gt;
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;raw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
```&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Das Modell kann das tatsächliche Rendering analysieren, statt sich auf eine menschliche Problembeschreibung zu verlassen.&lt;/p&gt;

&lt;h3&gt;
  
  
  Designvergleich
&lt;/h3&gt;

&lt;p&gt;Vergleichen Sie zwei Bilder direkt. Das eignet sich als weicher CI-Check für visuelle Regressionen: Ein Diff-Tool erkennt geänderte Pixel, das Modell priorisiert, welche Unterschiede ein Mensch prüfen sollte.&lt;/p&gt;

&lt;p&gt;Verwenden Sie das Ergebnis nicht als alleinige Grundlage, um Deployments zu blockieren. Ein Modellvergleich ist eine Einschätzung, keine zuverlässige Behauptung.&lt;/p&gt;

&lt;h3&gt;
  
  
  Dokumente mit ihrer Spezifikation prüfen
&lt;/h3&gt;

&lt;p&gt;Der 1M-Kontext erlaubt es, lange Spezifikationen und gerenderte Artefakte gemeinsam zu prüfen:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Specification:&lt;/span&gt;&lt;span class="se"&gt;\n\n&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;spec_text&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Below is the generated report. Does it satisfy every requirement above? List gaps.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;generated-report.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Eine 40-seitige Spezifikation und ein Bild in einem Prompt wären mit einem 128K-Kontextfenster und adapterbasierter Vision kaum praktikabel. Das ist die zentrale neue Fähigkeit.&lt;/p&gt;

&lt;p&gt;Die Release Notes von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; nennen außerdem Bürodokumente und Finanzforschung als Ziel-Workflows für das agentische Verhalten des Modells.&lt;/p&gt;

&lt;h3&gt;
  
  
  Diagramme und Dashboards
&lt;/h3&gt;

&lt;p&gt;Fordern Sie für Diagrammextraktion JSON an und validieren Sie es anschließend:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Extract the series in this chart as JSON: [{label, values: [...]}]
Return only JSON.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nf"&gt;image_block&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;quarterly.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Validieren Sie gegen ein Schema. Diagrammlesen kann selbstbewusst falsche Werte liefern; Schema-Validierung erkennt Formfehler, aber keine plausiblen falschen Zahlen.&lt;/p&gt;

&lt;p&gt;Für dedizierte Dokumentenextraktion kann ein Spezialmodell besser geeignet sein. Siehe &lt;a href="https://apidog.com/de/blog/glm-ocr-document-understanding?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-OCR für das Dokumentenverständnis&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Video und Dateien
&lt;/h2&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; dokumentiert Video- und Dateieingaben über denselben Inhaltsblock-Mechanismus.&lt;/p&gt;

&lt;p&gt;Behandeln Sie diese Unterstützung vorsichtig: Video ist neu, nur begrenzt dokumentiert und deutlich weniger erprobt als Bildeingabe. Außerdem bedeutet eine Modellfunktion nicht automatisch, dass Ihr Gateway sie unterstützt.&lt;/p&gt;

&lt;p&gt;Testen Sie Video mit eigenen Medien und Ihrem tatsächlichen Anbieter, bevor Sie Ihre Anwendung darauf aufbauen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Wo es Schwächen zeigt
&lt;/h2&gt;

&lt;p&gt;Native Multimodalität bedeutet nicht automatisch zuverlässige Multimodalität. Berücksichtigen Sie diese Fehlermodi:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Zuversichtliche Zahlen aus Diagrammen:&lt;/strong&gt; Gezeichnete Linien können zu präzise formatierten, aber falschen Werten führen. Bei wichtigen Zahlen verwenden Sie die Quelldaten statt eines Diagrammbilds.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Kleiner Text:&lt;/strong&gt; Dichte UI-Screenshots, niedrig aufgelöste Tabellen und komprimierter Code verschlechtern die Ergebnisse. Schneiden Sie relevante Bereiche zu, statt das gesamte Bild stark zu verkleinern.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Räumliche Präzision:&lt;/strong&gt; „Der Button überlappt das Eingabefeld“ ist meist zuverlässig. „Der Button ist 12 Pixel zu weit links“ meist nicht.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Reihenfolge und Referenzen:&lt;/strong&gt; Bei mehreren Bildern kann das Modell Details dem falschen Bild zuordnen. Beschriften Sie Bilder und halten Sie die Anzahl niedrig, wenn Präzision entscheidend ist.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Diese Grenzen gelten allgemein für Vision-Sprachmodelle. Auch der Intelligence-Index-Score von 57 hebt sie nicht auf. Gestalten Sie Workflows so, dass falsche Antworten erkannt werden, bevor sie umgesetzt werden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Kosten
&lt;/h2&gt;

&lt;p&gt;Bilder verbrauchen Eingabe-Tokens und werden als solche abgerechnet; es gibt keinen separaten Bildzuschlag.&lt;/p&gt;

&lt;p&gt;Der Listenpreis beträgt 0,15 $ pro Million Eingabe-Tokens beziehungsweise 0,075 $ während des Einführungsrabatts bis zum 9. September 2026. Hochauflösende Bilder können viele Tokens verbrauchen, daher beeinflusst die Auflösung die Kosten direkt.&lt;/p&gt;

&lt;p&gt;&lt;code&gt;reasoning_effort&lt;/code&gt; ist standardmäßig auf &lt;code&gt;max&lt;/code&gt; gesetzt und rechnet Argumentation als Ausgabe-Tokens ab. Für einfache Bildextraktion ist &lt;code&gt;low&lt;/code&gt; meist günstiger und ausreichend. Weitere Details finden Sie in der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisübersicht&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bildkosten kontrollieren
&lt;/h2&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fixyf70kl0ow7x1kbgod6.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fixyf70kl0ow7x1kbgod6.png" width="798" height="239"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Praktische Reihenfolge:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Vor dem Skalieren zuschneiden:&lt;/strong&gt; Senden Sie den relevanten Bereich in hoher Auflösung, statt den gesamten Bildschirm zu halbieren.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Auflösung an die Frage anpassen:&lt;/strong&gt; „Ist das Layout defekt?“ verträgt starkes Herunterskalieren. „Was steht in dieser Fehlermeldung?“ nicht.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Unveränderte Bilder nicht erneut senden:&lt;/strong&gt; Bereits gesendete Bilder bleiben im Kontext. Wiederholtes Anhängen verursacht erneut Kosten.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;reasoning_effort&lt;/code&gt; bewusst setzen:&lt;/strong&gt; Für einfache Extraktion ist &lt;code&gt;max&lt;/code&gt; selten nötig.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Das &lt;code&gt;usage&lt;/code&gt;-Objekt jeder Antwort liefert die tatsächliche Token-Anzahl. Das ist zuverlässiger, als Kosten aus der Dateigröße abzuleiten.&lt;/p&gt;

&lt;h2&gt;
  
  
  Multimodale Aufrufe testen
&lt;/h2&gt;

&lt;p&gt;Multimodale Anfragen sind manuell schwer zu testen: Base64-Daten-URLs sind lang, Curl-Befehle unlesbar und Freitext-Antworten machen Regressionen leicht übersehbar.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fbnb029ymb4ypilnx3nqy.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fbnb029ymb4ypilnx3nqy.png" width="799" height="530"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Nutzen Sie einen kleinen, festen Satz an Referenzbildern und erwarteten Antworten. Validieren Sie strukturierte Extraktion immer gegen ein Schema.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; hilft dabei, Bild-Payloads in gespeicherten Anfragen statt Shell-Befehlen zu verwalten, API-Schlüssel als Umgebungsvariablen zu speichern und Assertions für JSON-Extraktionen anzulegen. Wenn Sie Modelle oder Anbieter wechseln, zeigt ein erneuter Testlauf, ob der Vision-Pfad weiterhin funktioniert.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Unterstützt GLM-5.3 auch Bilder?&lt;/strong&gt; Nicht nativ. GLM-5.3 leitet Vision über separate Adapter. Flash ist das nativ multimodale Modell; Details stehen in &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vs-glm-5-3?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;unserem Vergleich&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wie viele Bilder pro Anfrage?&lt;/strong&gt; Mehrere, jeweils als eigener &lt;code&gt;image_url&lt;/code&gt;-Block. Die praktische Grenze ist Ihr Kontextbudget.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;URL oder Base64?&lt;/strong&gt; Beides funktioniert. Verwenden Sie öffentliche URLs für bereits gehostete Bilder und Base64 für lokale oder private Bilder.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Akzeptiert es Video?&lt;/strong&gt; &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; dokumentiert Videoeingaben, aber die Funktion ist neu und wenig erprobt. Testen Sie sie mit eigenen Medien und Ihrem Anbieter.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Werden Bilder anders abgerechnet?&lt;/strong&gt; Nein. Sie verbrauchen Eingabe-Tokens, daher beeinflusst die Auflösung die Kosten.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>GLM-5.3-Flash Preise: Was es vor und nach dem Einführungsrabatt kostet</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:36:34 +0000</pubDate>
      <link>https://dev.to/emree_demir/glm-53-flash-preise-was-es-vor-und-nach-dem-einfuhrungsrabatt-kostet-1n20</link>
      <guid>https://dev.to/emree_demir/glm-53-flash-preise-was-es-vor-und-nach-dem-einfuhrungsrabatt-kostet-1n20</guid>
      <description>&lt;p&gt;GLM-5.3-Flash ist derzeit zum halben Preis erhältlich. Das Angebot endet am &lt;strong&gt;9. September 2026&lt;/strong&gt;; danach verdoppeln sich alle Kostenprognosen, die auf den heutigen Preisen basieren.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Testen Sie Apidog noch heute&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Alle Zahlen wurden am 27. August 2026 überprüft. Da Preisseiten sich ändern können, sollten Sie die Tarife bei Ihrem tatsächlichen Anbieter bestätigen, bevor Sie ein Budget festlegen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preise
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Einführungspreis bis 9. Sep. 2026&lt;/th&gt;
&lt;th&gt;Listenpreis danach&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eingabe&lt;/td&gt;
&lt;td&gt;$0.075 / 1 Mio. Token&lt;/td&gt;
&lt;td&gt;$0.15 / 1 Mio. Token&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ausgabe&lt;/td&gt;
&lt;td&gt;$0.25 / 1 Mio. Token&lt;/td&gt;
&lt;td&gt;$0.50 / 1 Mio. Token&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gecachte Eingabe&lt;/td&gt;
&lt;td&gt;$0.015 / 1 Mio. Token&lt;/td&gt;
&lt;td&gt;$0.03 / 1 Mio. Token&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Artificial Analysis nennt einen gemischten Wert von &lt;strong&gt;$0.10 pro Million Token&lt;/strong&gt; bei einem Cache-Hit-zu-Eingabe-zu-Ausgabe-Verhältnis von 7:2:1. Das ist ein nützlicher Vergleichswert, aber Ihre tatsächliche Token-Mischung bestimmt Ihre Rechnung.&lt;/p&gt;

&lt;h2&gt;
  
  
  Kosten für typische Workloads
&lt;/h2&gt;

&lt;p&gt;Die folgenden Beispiele verwenden den &lt;strong&gt;Listenpreis&lt;/strong&gt; nach dem 9. September.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Support-Klassifikator:&lt;/strong&gt; 100.000 Tickets pro Monat mit jeweils etwa 800 Eingabe- und 100 Ausgabetoken ergeben 80 Mio. Eingabe- und 10 Mio. Ausgabetoken. Kosten: &lt;strong&gt;$12.00 Eingabe + $5.00 Ausgabe = $17 pro Monat&lt;/strong&gt;. Setzen Sie &lt;code&gt;reasoning_effort&lt;/code&gt; auf &lt;code&gt;low&lt;/code&gt;, um die Ausgabekosten weiter zu senken.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Programmierassistent:&lt;/strong&gt; 500 Sitzungen täglich mit jeweils 15.000 Eingabe- und 2.000 Ausgabetoken ergeben monatlich 225 Mio. Eingabe- und 30 Mio. Ausgabetoken. Ohne Caching: &lt;strong&gt;$48.75 pro Monat&lt;/strong&gt;. Bei 70 % Cache-Hits sinken die Eingabekosten auf etwa $14.85 und die Gesamtkosten auf &lt;strong&gt;etwa $30&lt;/strong&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Dokumenten-Pipeline mit Bildern:&lt;/strong&gt; 10.000 Dokumente monatlich mit etwa 40.000 Eingabe- und 1.500 Ausgabetoken pro Dokument ergeben 400 Mio. Eingabe- und 15 Mio. Ausgabetoken. Kosten: &lt;strong&gt;$60.00 Eingabe + $7.50 Ausgabe = $67.50 pro Monat&lt;/strong&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Cache-Treffer sind Ihr größter Hebel
&lt;/h2&gt;

&lt;p&gt;Gecachte Eingabe kostet mit $0.03 pro Million Token nur &lt;strong&gt;ein Fünftel&lt;/strong&gt; frischer Eingabe bei $0.15. Strukturieren Sie Prompts daher so:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Stabilen Inhalt zuerst: System-Prompt, wiederverwendete Dokumente, Codebasis-Kontext.&lt;/li&gt;
&lt;li&gt;Variable Inhalte zuletzt: Zeitstempel, Anfrage-IDs, Benutzernamen und aktuelle Eingaben.&lt;/li&gt;
&lt;li&gt;Das stabile Präfix über Aufrufe hinweg bytegenau identisch halten.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Ein variabler Wert am Anfang des Prompts kann den Cache für alles Folgende ungültig machen.&lt;/p&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; führt die Speicherung gecachter Eingaben für einen begrenzten Zeitraum als kostenlos auf. Behandeln Sie das als Werbeaktion und prüfen Sie die aktuellen Bedingungen, bevor Sie Ihre Architektur darauf stützen.&lt;/p&gt;

&lt;h2&gt;
  
  
  &lt;code&gt;reasoning_effort&lt;/code&gt; aktiv steuern
&lt;/h2&gt;

&lt;p&gt;Bei GLM-5.3-Flash ist &lt;code&gt;reasoning_effort&lt;/code&gt; standardmäßig auf &lt;strong&gt;&lt;code&gt;max&lt;/code&gt;&lt;/strong&gt; gesetzt. Das ist die teuerste Einstellung.&lt;/p&gt;

&lt;p&gt;Verfügbare Modi:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;low&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;high&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;max&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Denktoken werden als Ausgabe abgerechnet. Für Klassifizierung, Extraktion, Routing und Formatierung ist &lt;code&gt;low&lt;/code&gt; oft ausreichend und kann die Ausgabekosten deutlich reduzieren.&lt;/p&gt;

&lt;p&gt;Die Konfiguration ist in &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;unserem API-Leitfaden&lt;/a&gt; beschrieben. Es ist eine Änderung in einer Zeile und sollte Ihr erster Test sein, wenn Ihre Rechnung höher ausfällt als erwartet.&lt;/p&gt;

&lt;h2&gt;
  
  
  Vergleich mit GLM-5.3
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Modell&lt;/th&gt;
&lt;th&gt;Durchschnitt pro 1 Mio. Token&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GLM-5.3-Flash&lt;/td&gt;
&lt;td&gt;$0.10&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GLM-5.3&lt;/td&gt;
&lt;td&gt;$0.90&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Das entspricht etwa dem neunfachen Preis bei nur drei Punkten Unterschied im Artificial Analysis Intelligence Index: 57 gegenüber 60.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vs-glm-5-3?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Unser vollständiger Vergleich&lt;/a&gt; erklärt, wann GLM-5.3 trotzdem die bessere Wahl ist: insbesondere bei langen Antworten, die an wartende Personen gestreamt werden, da GLM-5.3 fast doppelt so schnell generiert.&lt;/p&gt;

&lt;p&gt;Gegenüber GLM-5.2 liegt die Aussage von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; bei etwa &lt;strong&gt;einem Zehntel des Preises&lt;/strong&gt; sowie bei Kosten pro Aufgabe von $0.045. Unsere &lt;a href="https://apidog.com/de/blog/glm-5-2-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.2-Preisübersicht&lt;/a&gt; enthält die ältere Preisliste für Migrationsbudgets.&lt;/p&gt;

&lt;p&gt;Im Vergleich zu den günstigen multimodalen Stufen anderer Anbieter ist GLM-5.3-Flash preislich wettbewerbsfähig. Zudem ist es MIT-lizenziert, sodass Self-Hosting möglich bleibt. Der engste Google-Vergleich findet sich in unserem &lt;a href="https://apidog.com/de/blog/gemini-3-7-flash-pricing-explained?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Beitrag zur Gemini-3.7-Flash-Preisgestaltung&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Wiederverkäufer können deutlich teurer sein
&lt;/h2&gt;

&lt;p&gt;Das Modell ist direkt über &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; sowie über OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten und &lt;a href="http://io.net" rel="noopener noreferrer"&gt;io.net&lt;/a&gt; verfügbar.&lt;/p&gt;

&lt;p&gt;Die Preise sind nicht einheitlich. AIHubMix führte beispielsweise etwa $0.113 für Eingabe und $0.394 für Ausgabe auf — zwischen Aktions- und Listenpreis von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;. Einige Anbieter reichen den Einführungsrabatt weiter, andere nicht.&lt;/p&gt;

&lt;p&gt;Wenn Sie über einen Aggregator routen, prüfen Sie dessen aktuellen Tarif. Ein einheitliches Gateway kann eine Marge enthalten, die bei diesen niedrigen absoluten Preisen leicht zu übersehen ist.&lt;/p&gt;

&lt;h2&gt;
  
  
  Wann sich Self-Hosting lohnt
&lt;/h2&gt;

&lt;p&gt;Die Gewichte sind MIT-lizenziert. Für Full-Precision-Serving benötigen Sie grob einen Knoten der H200-Klasse mit 8 GPUs. Gemietete Cloud-Kapazität kostet dafür etwa &lt;strong&gt;$24 bis $48 pro Tag&lt;/strong&gt;, also ungefähr &lt;strong&gt;$1.000 pro Monat&lt;/strong&gt; unabhängig von der Auslastung.&lt;/p&gt;

&lt;p&gt;Zum API-Listenpreis entsprechen $1.000 etwa &lt;strong&gt;6,7 Milliarden Eingabetoken&lt;/strong&gt;. Sie benötigen daher ein sehr hohes und konstantes Volumen, bevor sich ein eigener Knoten allein über Kosten lohnt.&lt;/p&gt;

&lt;p&gt;Für die meisten Teams geht es bei Self-Hosting eher um:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Kontrolle&lt;/li&gt;
&lt;li&gt;Datenresidenz&lt;/li&gt;
&lt;li&gt;Lizenzierung&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die Ausnahme sind quantisierte Builds. GGUF-Quantisierungen existieren; wenn Sie bereits passende Hardware besitzen, sind die Grenzkosten hauptsächlich Strom. Unser &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-locally?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Leitfaden für den lokalen Betrieb&lt;/a&gt; zeigt, was die einzelnen Hardware-Stufen leisten können.&lt;/p&gt;

&lt;h2&gt;
  
  
  Für Entwickler: der Coding-Plan
&lt;/h2&gt;

&lt;p&gt;Wenn ein einzelner Entwickler GLM-5.3-Flash über Claude Code oder Cline nutzt, ist Preisgestaltung pro Token möglicherweise nicht das passende Modell.&lt;/p&gt;

&lt;p&gt;Der GLM Coding Plan beginnt bei etwa &lt;strong&gt;$18 pro Monat&lt;/strong&gt;, enthält GLM-5.3-Flash und soll die &lt;strong&gt;dreifache nutzbare Quote&lt;/strong&gt; von GLM-5.3 bieten. Laut &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; verbrauchen Off-Peak-Aufrufe zudem nur die Hälfte der Standardpunkte.&lt;/p&gt;

&lt;p&gt;Für tägliche Entwicklungsarbeit ist ein Pauschalplan meist günstiger und besser vorhersehbar als getakteter API-Zugang. Unser &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-claude-code-cline?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Leitfaden zur Einrichtung des Harness&lt;/a&gt; erklärt die Einrichtung. Der &lt;a href="https://apidog.com/de/blog/claude-code-vs-codex-vs-cursor-vs-minimax-plan-vs-glm-plan?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Vergleich der Coding-Pläne&lt;/a&gt; stellt den GLM-Plan den Alternativen gegenüber.&lt;/p&gt;

&lt;h2&gt;
  
  
  Überwachen Sie Ausgabetoken
&lt;/h2&gt;

&lt;p&gt;Eingabetoken erhalten oft mehr Aufmerksamkeit, weil ihre Mengen größer wirken. Budgets platzen jedoch häufig auf der Ausgabeseite:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Ausgabe kostet &lt;strong&gt;mehr als das Dreifache&lt;/strong&gt; der Eingabe: $0.50 gegenüber $0.15 pro Million Token.&lt;/li&gt;
&lt;li&gt;Denktoken werden als Ausgabe berechnet.&lt;/li&gt;
&lt;li&gt;Bei &lt;code&gt;reasoning_effort: max&lt;/code&gt; kann das Modell deutlich mehr Token erzeugen, als in der finalen Antwort sichtbar sind.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Damit kann ein Workload mit kurzem Prompt und gesprächigem Modell ausgabe-dominiert sein, obwohl er auf dem Papier eingabe-lastig aussieht. Der gemischte Vergleichswert von $0.10 setzt ein Verhältnis von 7:2:1 voraus, das viele reale Workloads nicht erreichen.&lt;/p&gt;

&lt;p&gt;Messen Sie statt zu schätzen:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Protokollieren Sie das &lt;code&gt;usage&lt;/code&gt;-Objekt jeder Vervständigungsantwort.&lt;/li&gt;
&lt;li&gt;Aggregieren Sie Eingabe-, Ausgabe- und Cache-Token.&lt;/li&gt;
&lt;li&gt;Vergleichen Sie die tatsächliche Mischung mit Ihrer Budgetannahme.&lt;/li&gt;
&lt;li&gt;Liegt Ausgabe über etwa 15 % aller Token, prüfen Sie zuerst &lt;code&gt;reasoning_effort&lt;/code&gt; und danach die Prompt-Länge.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Führen Sie repräsentative Aufrufe als gespeicherte Sammlung in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; aus. Verwenden Sie die Modell-ID als Umgebungsvariable, erfassen Sie die Tokenwerte pro Anfrage und führen Sie dieselbe Suite anschließend gegen GLM-5.3 aus. So vergleichen Sie reale Rechnungen statt Marketingangaben.&lt;/p&gt;

&lt;h2&gt;
  
  
  Checkliste vor dem 9. September
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Messen Sie Ihre tatsächliche Token-Mischung.&lt;/strong&gt; Der gemischte Satz basiert auf 7:2:1. Bei ausgabe-lastigen Workloads liegen die effektiven Kosten näher bei $0.50 als bei $0.10 pro Million Token.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Prüfen Sie Ihre Cache-Trefferrate.&lt;/strong&gt; Der Unterschied zwischen frischer und gecachter Eingabe beträgt Faktor 5.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Rechnen Sie mit Listenpreisen neu.&lt;/strong&gt; Ab dem 10. September verdoppelt sich alles. Wenn Ihr Workload nur mit dem Aktionspreis rentabel ist, müssen Sie das jetzt lösen.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Ist GLM-5.3-Flash kostenlos?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nein. Es war etwa eine Woche kostenlos, als es vor dem Start anonym als „ox-alpha“ lief. Der aktuelle Rabatt von 50 % ist kein kostenloses Angebot.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wann endet der Rabatt?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Am 9. September 2026. Danach gelten die Listenpreise.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Warum unterscheiden sich die Preise je nach Website?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Einige nennen Aktionspreise, andere Listenpreise; Wiederverkäufer setzen außerdem eigene Margen fest. Prüfen Sie stets den Anbieter, den Ihre Anwendung tatsächlich aufruft.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kosten Bildeingaben extra?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Bilder verbrauchen Kontext-Token und werden als Eingabe abgerechnet. Es gibt keinen separaten Bildzuschlag, aber hochauflösende Bilder können viele Token verbrauchen.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Ist Self-Hosting günstiger?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nur bei sehr großem, dauerhaftem Volumen oder bei vorhandener Hardware mit quantisiertem Build. Bei $0.15 pro Million Eingabetoken ist die Anmietung eines 8x-H200-Knotens allein aus Kostengründen schwer zu rechtfertigen.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>GLM-5.3-Flash vs GLM-5.3: Welches Modell sollten Sie tatsächlich nutzen?</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:33:50 +0000</pubDate>
      <link>https://dev.to/emree_demir/glm-53-flash-vs-glm-53-welches-modell-sollten-sie-tatsachlich-nutzen-5a40</link>
      <guid>https://dev.to/emree_demir/glm-53-flash-vs-glm-53-welches-modell-sollten-sie-tatsachlich-nutzen-5a40</guid>
      <description>&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; bietet zwei Modelle mit fast identischem Namen, demselben 1M-Token-Kontextfenster und einem neunfachen Preisunterschied. Der Name „Flash“ ist dabei irreführend: Das Modell ist günstiger und multimodal, aber nicht schneller.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Teste Apidog noch heute&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kurzfassung:&lt;/strong&gt; &lt;strong&gt;GLM-5.3-Flash ist günstiger, verarbeitet Bilder nativ und bietet im Coding Plan die dreifache Quote. GLM-5.3 ist etwas intelligenter und erzeugt Antworten fast doppelt so schnell.&lt;/strong&gt; Für die meisten Workloads ist Flash die sinnvollere Standardeinstellung. Das teurere Modell lohnt sich vor allem bei langen, interaktiven Ausgaben oder anspruchsvollen mehrstufigen Schlussfolgerungen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Vergleich auf einen Blick
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;GLM-5.3-Flash&lt;/th&gt;
&lt;th&gt;GLM-5.3&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Intelligenzindex (Artificial Analysis)&lt;/td&gt;
&lt;td&gt;57&lt;/td&gt;
&lt;td&gt;60&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mischpreis pro 1 Mio. Tokens&lt;/td&gt;
&lt;td&gt;$0,10&lt;/td&gt;
&lt;td&gt;$0,90&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Listenpreis Eingabe / Ausgabe pro 1 Mio.&lt;/td&gt;
&lt;td&gt;$0,15 / $0,50&lt;/td&gt;
&lt;td&gt;$1,40 / $4,40&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ausgabegeschwindigkeit&lt;/td&gt;
&lt;td&gt;~49 Tokens/Sek.&lt;/td&gt;
&lt;td&gt;~86 Tokens/Sek.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Zeit bis zum ersten Token&lt;/td&gt;
&lt;td&gt;1,52 s&lt;/td&gt;
&lt;td&gt;1,57 s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kontextfenster&lt;/td&gt;
&lt;td&gt;1.048.576 Tokens&lt;/td&gt;
&lt;td&gt;1.048.576 Tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Native Bildeingabe&lt;/td&gt;
&lt;td&gt;Ja&lt;/td&gt;
&lt;td&gt;Nein, adapterbasiert&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Parameter&lt;/td&gt;
&lt;td&gt;320B gesamt / 18B aktiv&lt;/td&gt;
&lt;td&gt;Größer, nicht vollständig offengelegt&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lizenz&lt;/td&gt;
&lt;td&gt;MIT, offene Gewichte&lt;/td&gt;
&lt;td&gt;Offene Gewichte&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Coding-Plan-Quote&lt;/td&gt;
&lt;td&gt;3x&lt;/td&gt;
&lt;td&gt;1x&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Geschwindigkeits- und Intelligenzwerte stammen von Artificial Analysis. Die Preise entsprechen der &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Preisliste vor dem unten beschriebenen Einführungsrabatt.&lt;/p&gt;

&lt;h2&gt;
  
  
  Warum Flash neunmal weniger kostet
&lt;/h2&gt;

&lt;p&gt;GLM-5.3-Flash ist ein 320B-Mixture-of-Experts-Modell, das pro Token nur 18B Parameter aktiviert. Es nutzt eine neue Basis mit hybrider linearer und sparsamer Aufmerksamkeit. Laut &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; benötigt es etwa dreimal weniger Aufmerksamkeitsberechnung als GLM-5.3 und verwendet einen etwa 4,4-mal kleineren KV-Cache.&lt;/p&gt;

&lt;p&gt;Das ist entscheidend für lange Kontexte: Der KV-Cache bestimmt einen großen Teil der Infrastrukturkosten. Ein 4,4-mal kleinerer Cache ermöglicht ein 1M-Token-Fenster zu deutlich geringeren Kosten.&lt;/p&gt;

&lt;p&gt;Der Preisvorteil ist damit strukturell, nicht nur ein kurzfristiger Rabatt: Sie bezahlen nicht für einen kleineren Kontext oder ein deutlich schwächeres Modell, sondern für einen geringeren Bereitstellungs-Footprint pro Anfrage.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was die Intelligenzlücke von drei Punkten bedeutet
&lt;/h2&gt;

&lt;p&gt;57 gegenüber 60 Punkten klingt gering – und ist es im Vergleich zu vielen offenen Modellen auch. Das Medianmodell mit offenen Gewichten vergleichbarer Größe erreicht nur etwa 27 Punkte.&lt;/p&gt;

&lt;p&gt;In der Praxis zeigt sich die Lücke vor allem bei:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;mehrstufigen Schlussfolgerungen,&lt;/li&gt;
&lt;li&gt;sehr langen agentenbasierten Aufgaben,&lt;/li&gt;
&lt;li&gt;mehrdeutigen Anweisungen,&lt;/li&gt;
&lt;li&gt;Aufgaben, bei denen sich kleine Fehler über mehrere Schritte summieren.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Bei Extraktion, Klassifizierung, Zusammenfassung, Routing oder Einzeldatei-Codeänderungen ist der Unterschied meist kaum relevant.&lt;/p&gt;

&lt;p&gt;Eine praktische Regel:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Überprüfbare Ausgabe:&lt;/strong&gt; Nutzen Sie Flash. Fehler lassen sich automatisiert erkennen und günstig wiederholen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Menschlich bewertete Prosa oder Entscheidungen:&lt;/strong&gt; GLM-5.3 kann den Mehrpreis wert sein, wenn die Ausgabequalität wichtiger als Tokenkosten ist.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Geschwindigkeit: Hier verliert Flash tatsächlich
&lt;/h2&gt;

&lt;p&gt;Der Modellname ist hier besonders irreführend:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;GLM-5.3:&lt;/strong&gt; etwa 86 Tokens/Sek.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;GLM-5.3-Flash:&lt;/strong&gt; etwa 49 Tokens/Sek.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die Zeit bis zum ersten Token ist mit 1,52 gegenüber 1,57 Sekunden praktisch identisch. Beide fühlen sich beim Start einer Antwort ähnlich schnell an. Der Unterschied wird erst bei längeren Ausgaben sichtbar.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Kurze Antworten:&lt;/strong&gt; praktisch kein Unterschied.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Lange Generierungen:&lt;/strong&gt; 4.000 Tokens dauern bei Flash etwa 82 Sekunden, bei GLM-5.3 etwa 47 Sekunden.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Batch-Jobs mit Parallelität:&lt;/strong&gt; meist weniger relevant, weil Sie über parallele Anfragen skalieren können – und Flash wegen seines Preises deutlich mehr Parallelität erlaubt.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Wenn Menschen auf lange gestreamte Antworten warten, bietet GLM-5.3 die bessere Erfahrung. Das ist der klarste Grund, den höheren Preis zu zahlen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Multimodalität ist die eigentliche Trennlinie
&lt;/h2&gt;

&lt;p&gt;GLM-5.3-Flash akzeptiert Bilder, Videos und Dateien direkt als Inhaltsblöcke innerhalb derselben Chat-Completion-Anfrage wie Ihren Text. GLM-5.3 unterstützt Bildverarbeitung nicht nativ, sondern über separate Adapter.&lt;/p&gt;

&lt;p&gt;Wenn Ihre Anwendung Inhalte analysieren oder visuell prüfen muss, ist Flash nicht einfach günstiger – sondern funktional besser geeignet.&lt;/p&gt;

&lt;p&gt;Das Zusammenspiel aus nativer Vision-Unterstützung und 1M-Token-Kontext ermöglicht beispielsweise, ein langes Spezifikationsdokument und einen Screenshot des implementierten Ergebnisses im selben Prompt zu prüfen. &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; positioniert das Modell entsprechend für das Beobachten von Schnittstellen und die Reproduktion von Ergebnissen – ein klarer Agentic-Coding-Anwendungsfall.&lt;/p&gt;

&lt;p&gt;Weitere Umsetzungshinweise finden Sie im &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vision-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Vision-Leitfaden&lt;/a&gt;. Falls Sie bestehende Vision-Workflows migrieren, hilft der &lt;a href="https://apidog.com/de/blog/glm-5v-turbo-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden zu GLM-5V-Turbo&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Coding Plan: Dreifache Quote macht Flash zur Standardwahl
&lt;/h2&gt;

&lt;p&gt;Für Nutzer des GLM Coding Plans ist die Entscheidung oft einfach:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Flash ist im Plan enthalten.&lt;/li&gt;
&lt;li&gt;Flash bietet Berichten zufolge die &lt;strong&gt;dreifache nutzbare Quote&lt;/strong&gt; von GLM-5.3.&lt;/li&gt;
&lt;li&gt;Anrufe außerhalb der Spitzenzeiten verbrauchen laut &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; nur die Hälfte der Standardpunkte.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Wenn Sie Claude Code oder Cline gegen Ihr Planziel einsetzen, ist die dreifache Anzahl möglicher Anfragen für einen Rückgang um drei Indexpunkte ein attraktiver Tausch für Routineaufgaben.&lt;/p&gt;

&lt;p&gt;Praktische Aufteilung:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Flash:&lt;/strong&gt; Volumenarbeit, Routine-Code, Extraktion, Klassifizierung, visuelle Prüfungen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;GLM-5.3:&lt;/strong&gt; schwierige Bugs, lange Schlussfolgerungsketten und qualitätskritische Ausgaben.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die Einrichtung für beide Harnesses beschreibt der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-claude-code-cline?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Claude-Code- und-Cline-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Prüfen Sie den Quotenmultiplikator vor der Planung direkt bei &lt;a href="http://z.ai" rel="noopener noreferrer"&gt;z.ai&lt;/a&gt;, da sich Planbedingungen schneller ändern können als Modellspezifikationen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Einführungsrabatt bis 9. September 2026
&lt;/h2&gt;

&lt;p&gt;Für GLM-5.3-Flash gilt bis zum &lt;strong&gt;9. September 2026&lt;/strong&gt; ein Einführungsrabatt von 50 %.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Zeitraum&lt;/th&gt;
&lt;th&gt;Eingabe pro 1 Mio. Tokens&lt;/th&gt;
&lt;th&gt;Ausgabe pro 1 Mio. Tokens&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Während des Rabatts&lt;/td&gt;
&lt;td&gt;$0,075&lt;/td&gt;
&lt;td&gt;$0,25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Listenpreis danach&lt;/td&gt;
&lt;td&gt;$0,15&lt;/td&gt;
&lt;td&gt;$0,50&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Während des Rabatts vergrößert sich der Preisabstand zu GLM-5.3 auf etwa das Achtzehnfache. Danach liegt er wieder bei ungefähr dem Neunfachen.&lt;/p&gt;

&lt;p&gt;Der Rabatt ist wichtig für Kostenprognosen, aber nicht für die grundsätzliche Modellwahl: Flash bleibt in beiden Fällen deutlich günstiger. Die vollständigen Berechnungen finden Sie in der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisübersicht&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Entscheidungsregel
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Verwenden Sie GLM-5.3-Flash, wenn:
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Ihre Eingaben Bilder, Videos oder Dateien enthalten.&lt;/li&gt;
&lt;li&gt;Sie Kosten pro Token optimieren müssen.&lt;/li&gt;
&lt;li&gt;Sie Extraktion, Klassifizierung oder Routing mit hohem Volumen ausführen.&lt;/li&gt;
&lt;li&gt;Sie den Coding Plan nutzen und Ihre Quote maximieren möchten.&lt;/li&gt;
&lt;li&gt;Sie MIT-lizenzierte offene Gewichte selbst hosten möchten.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-locally?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Leitfaden zum lokalen Betrieb&lt;/a&gt; behandelt die Hardwareanforderungen.&lt;/p&gt;

&lt;h3&gt;
  
  
  Verwenden Sie GLM-5.3, wenn:
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Sie lange Antworten an wartende Menschen streamen.&lt;/li&gt;
&lt;li&gt;Ihre Aufgabe aufwändige mehrstufige Schlussfolgerungen erfordert.&lt;/li&gt;
&lt;li&gt;Menschen die Ausgabe beurteilen und keine automatisierte Prüfung möglich ist.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Verwenden Sie beide, wenn Sie routen können
&lt;/h3&gt;

&lt;p&gt;Senden Sie den Großteil des Traffics an Flash und eskalieren Sie bei Fehlern, geringem Vertrauen oder bestimmten Aufgabentypen zu GLM-5.3.&lt;/p&gt;

&lt;p&gt;Da beide Modelle über denselben OpenAI-kompatiblen Endpunkt verfügbar sind, ist das Routing kein Integrationsprojekt, sondern im Wesentlichen ein Wechsel der Modell-ID.&lt;/p&gt;

&lt;h2&gt;
  
  
  Zwischen den Modellen migrieren
&lt;/h2&gt;

&lt;p&gt;Der technische Wechsel ist einfach. Die Validierung Ihrer realen Workloads ist der wichtige Teil.&lt;/p&gt;

&lt;h3&gt;
  
  
  Was gleich bleibt
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Basis-URL&lt;/li&gt;
&lt;li&gt;Authentifizierungsschema&lt;/li&gt;
&lt;li&gt;Request- und Response-Strukturen&lt;/li&gt;
&lt;li&gt;Streaming-Semantik&lt;/li&gt;
&lt;li&gt;Tool-Calling-Schemas&lt;/li&gt;
&lt;li&gt;OpenAI-kompatible API-Oberfläche&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Der Wechsel erfolgt über die Modell-ID.&lt;/p&gt;

&lt;h3&gt;
  
  
  Was sich ändert
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Die Kosten pro Aufruf sinken bei Flash um etwa das Neunfache.&lt;/li&gt;
&lt;li&gt;Die Generierungsgeschwindigkeit sinkt ungefähr auf die Hälfte.&lt;/li&gt;
&lt;li&gt;Die Schlussfolgerungsqualität verschiebt sich um drei Indexpunkte.&lt;/li&gt;
&lt;li&gt;Flash bietet native Bildeingabe.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Was Sie vor dem Wechsel testen sollten
&lt;/h3&gt;

&lt;p&gt;Führen Sie reale Prompts mit beiden Modellen aus und vergleichen Sie:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Korrektheit&lt;/strong&gt; bei überprüfbaren Aufgaben
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;End-to-End-Latenz&lt;/strong&gt;, nicht nur die Zeit bis zum ersten Token
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Tokenverbrauch&lt;/strong&gt; aus dem &lt;code&gt;usage&lt;/code&gt;-Objekt jeder Antwort
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Verhalten bei Ihrem längsten realistischen Kontext&lt;/strong&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Der letzte Punkt ist besonders wichtig. Zwei Modelle können bei kurzen Prompts gleichwertig wirken und sich bei vollem Kontextfenster deutlich unterscheiden. Eine Benchmark-Tabelle zeigt dieses Verhalten nicht zuverlässig für Ihre Daten.&lt;/p&gt;

&lt;p&gt;Wenn Sie vom Basismodell kommen, lesen Sie zunächst &lt;a href="https://apidog.com/de/blog/what-is-glm-5-3?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Was ist GLM-5.3?&lt;/a&gt; und anschließend den &lt;a href="https://apidog.com/de/blog/how-to-use-glm-5-3-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.3-API-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Testen Sie mit Ihren eigenen Prompts
&lt;/h2&gt;

&lt;p&gt;Die oben genannten Zahlen stammen von Anbieterangaben oder Drittanbieter-Benchmarks. Sie sagen nicht zuverlässig voraus, wie sich beide Modelle bei Ihren Prompts, Kontexten und Qualitätsanforderungen verhalten.&lt;/p&gt;

&lt;p&gt;Richten Sie einen OpenAI-kompatiblen Client auf folgende Basis-URL aus:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://api.z.ai/api/paas/v4/
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Testen Sie dann dieselben Workloads mit:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;glm-5.3-flash
glm-5.3
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Vergleichen Sie Ausgaben, Latenz und Tokenverbrauch für den Traffic, der für Ihre Anwendung wichtig ist. Die konkrete Einrichtung beschreibt der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Ftgz44gopnu12qffcwj9y.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Ftgz44gopnu12qffcwj9y.png" width="799" height="530"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Speichern Sie den Vergleich als wiederholbare Testsuite. In &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; können Sie beide Requests in einer Sammlung ablegen, die Modell-ID als Umgebungsvariable definieren, Assertions für relevante Response-Felder hinzufügen und die Suite bei Preisänderungen oder einer neuen &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Revision erneut ausführen.&lt;/p&gt;

&lt;p&gt;Eine Modellentscheidung, die sich in 30 Sekunden erneut testen lässt, bleibt überprüfbar. Eine Entscheidung, die nur in der Shell-Historie existiert, nicht.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Ist GLM-5.3-Flash nur ein kleineres GLM-5.3?
&lt;/h3&gt;

&lt;p&gt;Nein. Flash ist ein separat trainiertes Basismodell mit anderer Aufmerksamkeitsarchitektur, keine Destillation und keine beschnittene Variante.&lt;/p&gt;

&lt;h3&gt;
  
  
  Haben beide dasselbe Kontextfenster?
&lt;/h3&gt;

&lt;p&gt;Ja. Beide unterstützen 1.048.576 Tokens.&lt;/p&gt;

&lt;h3&gt;
  
  
  Welches Modell ist besser für Coding?
&lt;/h3&gt;

&lt;p&gt;Flash erreicht laut &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; 84,3 Punkte bei Terminal-Bench 2.1 und 63,4 bei DeepSWE. GLM-5.3 ist bei allgemeiner Schlussfolgerung etwas stärker. Für Nutzer des Coding Plans ist die dreifache Quote von Flash häufig ausschlaggebend.&lt;/p&gt;

&lt;h3&gt;
  
  
  Kann ich ohne Codeänderungen wechseln?
&lt;/h3&gt;

&lt;p&gt;Ja. Beide Modelle verwenden denselben OpenAI-kompatiblen Endpunkt; Sie ändern lediglich die Modell-ID. Nur die native Bildeingabe ist Flash vorbehalten.&lt;/p&gt;

&lt;h3&gt;
  
  
  Bleibt der günstigere Preis bestehen?
&lt;/h3&gt;

&lt;p&gt;Der strukturelle Preisvorteil beruht auf einem kleineren KV-Cache und geringerer Aufmerksamkeitsberechnung und sollte daher bestehen bleiben. Der zusätzliche Einführungsrabatt von 50 % endet am &lt;strong&gt;9. September 2026&lt;/strong&gt;.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Anleitung: GLM-5.3-Flash API mit Bildeingabe nutzen</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:33:16 +0000</pubDate>
      <link>https://dev.to/emree_demir/anleitung-glm-53-flash-api-mit-bildeingabe-nutzen-29jg</link>
      <guid>https://dev.to/emree_demir/anleitung-glm-53-flash-api-mit-bildeingabe-nutzen-29jg</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.3-Flash API verwenden: Text, Bilder, Streaming und Tools
&lt;/h1&gt;

&lt;p&gt;GLM-5.3-Flash ist OpenAI-kompatibel: Verwenden Sie einen bestehenden Client, ändern Sie Basis-URL und Modell-ID. Neu ist die Bildeingabe: Das Modell akzeptiert Bilder und Text in derselben Anfrage über typisierte Inhaltsblöcke.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Probieren Sie Apidog noch heute aus&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Dieser Leitfaden zeigt Schlüsselverwaltung, Text- und Bildanfragen, &lt;code&gt;reasoning_effort&lt;/code&gt;, Streaming, Tool-Aufrufe und Fehlerbehandlung mit &lt;code&gt;glm-5.3-flash&lt;/code&gt;. Für Hintergrundinformationen lesen Sie den &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-what-is?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.3-Flash-Erklärer&lt;/a&gt;. Für GLM-5.3 selbst gibt es einen separaten &lt;a href="https://apidog.com/de/blog/how-to-use-glm-5-3-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F08%2Fimage-133.png%3Futm_source%3Ddev.to%26utm_medium%3Dwanda%26utm_content%3Dn8n-post-automation" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F08%2Fimage-133.png%3Futm_source%3Ddev.to%26utm_medium%3Dwanda%26utm_content%3Dn8n-post-automation" alt="GLM-5.3-Flash API" width="760" height="474"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  API-Schlüssel einrichten
&lt;/h2&gt;

&lt;p&gt;Erstellen Sie bei &lt;a href="http://z.ai" rel="noopener noreferrer"&gt;z.ai&lt;/a&gt; einen API-Schlüssel und speichern Sie ihn als Umgebungsvariable:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;ZAI_API_KEY&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"your-key-here"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Die Standard-Basis-URL lautet:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://api.z.ai/api/paas/v4/
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Für Claude Code oder Cline benötigen Sie die separate Coding-Plan-Basis-URL. Details finden Sie im &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-claude-code-cline?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Claude-Code-und-Cline-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Ersten Textaufruf ausführen
&lt;/h2&gt;

&lt;p&gt;Das offizielle OpenAI SDK funktioniert direkt:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;REDACTED&lt;/span&gt; &lt;span class="n"&gt;CREDENTIAL&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.z.ai/api/paas/v4/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explain what a KV cache is in two sentences.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Mit &lt;code&gt;curl&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://api.z.ai/api/paas/v4/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"[REDACTED CREDENTIAL] &lt;/span&gt;&lt;span class="nv"&gt;$ZAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "glm-5.3-flash",
    "messages": [
      {"role": "user", "content": "Explain what a KV cache is in two sentences."}
    ]
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Mit Node.js:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="k"&gt;import&lt;/span&gt; &lt;span class="nx"&gt;OpenAI&lt;/span&gt; &lt;span class="k"&gt;from&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;openai&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="k"&gt;new&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;({&lt;/span&gt;
  &lt;span class="na"&gt;apiKey&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="nx"&gt;process&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;env&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;ZAI_API_KEY&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
  &lt;span class="na"&gt;baseURL&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;https://api.z.ai/api/paas/v4/&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="k"&gt;await&lt;/span&gt; &lt;span class="nx"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;({&lt;/span&gt;
  &lt;span class="na"&gt;model&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
  &lt;span class="na"&gt;messages&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt; &lt;span class="na"&gt;role&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;user&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="na"&gt;content&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;Explain what a KV cache is in two sentences.&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt; &lt;span class="p"&gt;},&lt;/span&gt;
  &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;

&lt;span class="nx"&gt;console&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;log&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nx"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;content&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Abgesehen von Basis-URL und Modell-ID ist daran nichts GLM-spezifisch.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bilder senden
&lt;/h2&gt;

&lt;p&gt;Für Bildeingaben muss &lt;code&gt;content&lt;/code&gt; ein Array aus Inhaltsblöcken sein:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;This screenshot shows a rendering bug. What is wrong with the layout?&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                &lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://example.com/screenshots/broken-layout.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
                    &lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;},&lt;/span&gt;
            &lt;span class="p"&gt;],&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Das &lt;code&gt;url&lt;/code&gt;-Feld akzeptiert öffentliche URLs oder Base64-Daten-URLs. Für lokale oder private Bilder:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;

&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;broken-layout.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;rb&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;encoded&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;b64encode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read&lt;/span&gt;&lt;span class="p"&gt;()).&lt;/span&gt;&lt;span class="nf"&gt;decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;image_block&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data:image/png;base64,&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;encoded&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Senden Sie mehrere Bilder als mehrere &lt;code&gt;image_url&lt;/code&gt;-Blöcke. Platzieren Sie die Aufgabenbeschreibung vor den Bildern:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Does the second image match the design in the first?&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;design_data_url&lt;/span&gt;&lt;span class="p"&gt;}},&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;built_data_url&lt;/span&gt;&lt;span class="p"&gt;}},&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Z.ai dokumentiert auch Video- und Dateieingaben über denselben Mechanismus. Validieren Sie Video jedoch mit eigenen Medien, bevor Sie darauf produktive Funktionen aufbauen. Weitere Vision-Beispiele, einschließlich Screenshot-zu-Code, enthält der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vision-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.3-Flash-Vision-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Denkaufwand festlegen
&lt;/h2&gt;

&lt;p&gt;Steuern Sie den Denkaufwand mit &lt;code&gt;reasoning_effort&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Refactor this function for clarity.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="n"&gt;extra_body&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;reasoning_effort&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;low&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Unterstützte Werte:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;low&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;high&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;max&lt;/code&gt; — Standardwert und teuerster Modus&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Für Klassifizierung, Extraktion und andere hochvolumige Aufgaben ohne komplexes Reasoning sollten Sie &lt;code&gt;low&lt;/code&gt; setzen. GLM-5.2 bot nur &lt;code&gt;high&lt;/code&gt; und &lt;code&gt;max&lt;/code&gt;; &lt;code&gt;low&lt;/code&gt; ist neu in GLM-5.3-Flash.&lt;/p&gt;

&lt;p&gt;Im OpenAI Python SDK gehört &lt;code&gt;reasoning_effort&lt;/code&gt; in &lt;code&gt;extra_body&lt;/code&gt;, weil es kein Standard-OpenAI-Feld ist. In &lt;code&gt;curl&lt;/code&gt; ist es ein Top-Level-Feld.&lt;/p&gt;

&lt;h2&gt;
  
  
  Sampling-Parameter
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Anwendungsfall&lt;/th&gt;
&lt;th&gt;&lt;code&gt;temperature&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;&lt;code&gt;top_p&lt;/code&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Allgemein&lt;/td&gt;
&lt;td&gt;1.0&lt;/td&gt;
&lt;td&gt;0.95&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Codierung&lt;/td&gt;
&lt;td&gt;0.95&lt;/td&gt;
&lt;td&gt;1.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Der Unterschied ist gering. Bei inkonsistenten Code-Ausgaben sollten Sie das Codierungs-Profil testen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Streaming aktivieren
&lt;/h2&gt;

&lt;p&gt;Verwenden Sie die normale OpenAI-Streaming-Semantik:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;stream&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Write a bash script that rotates logs.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;delta&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;end&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;""&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;flush&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Laut Artificial Analysis erzeugt GLM-5.3-Flash etwa 49 Token pro Sekunde, gegenüber etwa 86 bei GLM-5.3. Die Zeit bis zum ersten Token liegt bei etwa 1,52 Sekunden: Die Ausgabe beginnt schnell, wird danach aber stetig statt sehr schnell geliefert.&lt;/p&gt;

&lt;h2&gt;
  
  
  Tool-Aufrufe verwenden
&lt;/h2&gt;

&lt;p&gt;Tools folgen dem Standard-OpenAI-Schema:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;tools&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;
        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;function&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;function&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;name&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;get_deployment_status&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;description&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Returns the current status of a named deployment.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parameters&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;object&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;properties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;service&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;string&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;description&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;The service name, for example &lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;checkout-api&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="p"&gt;}&lt;/span&gt;
                &lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;required&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;service&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
            &lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="p"&gt;}&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Is checkout-api healthy?&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="n"&gt;tools&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;tools&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;call&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;tool_calls&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;call&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;function&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;name&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;call&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;function&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;arguments&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Z.ai meldet für AutomationBench 48,8 Punkte gegenüber 26,2 bei GLM-5.2. Das sind Herstellerwerte, passen aber zur Ausrichtung auf Tool-Calling-Schleifen statt reine Einzel-Turn-Chats.&lt;/p&gt;

&lt;p&gt;Wenn Sie Tools aus einer bestehenden API ableiten möchten, zeigt dieser Beitrag, wie Sie eine &lt;a href="https://apidog.com/de/blog/openapi-spec-as-agent-tools?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;OpenAPI-Spezifikation in Agenten-Tools umwandeln&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Fehlerbehandlung für Produktion
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Ratenbegrenzungen
&lt;/h3&gt;

&lt;p&gt;Verwenden Sie exponentiellen Backoff mit Jitter:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;random&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;RateLimitError&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;call_with_retry&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="o"&gt;**&lt;/span&gt;&lt;span class="n"&gt;kwargs&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;attempt&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nf"&gt;range&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="k"&gt;try&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="o"&gt;**&lt;/span&gt;&lt;span class="n"&gt;kwargs&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="k"&gt;except&lt;/span&gt; &lt;span class="n"&gt;RateLimitError&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;attempt&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
                &lt;span class="k"&gt;raise&lt;/span&gt;
            &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;sleep&lt;/span&gt;&lt;span class="p"&gt;((&lt;/span&gt;&lt;span class="mi"&gt;2&lt;/span&gt; &lt;span class="o"&gt;**&lt;/span&gt; &lt;span class="n"&gt;attempt&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="n"&gt;random&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;random&lt;/span&gt;&lt;span class="p"&gt;())&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Ein fixes Wiederholungsintervall über viele Worker kann synchronisierte Retries und dauerhafte Ratenbegrenzungen erzeugen.&lt;/p&gt;

&lt;h3&gt;
  
  
  Kontextüberlauf
&lt;/h3&gt;

&lt;p&gt;Das Kontextfenster umfasst 1 Million Tokens. Lange Dokumente und hochauflösende Bilder verbrauchen gemeinsam Kontext. Verfolgen Sie das Token-Budget bereits beim Eingang der Daten.&lt;/p&gt;

&lt;h3&gt;
  
  
  Abgeschnittene Ausgaben
&lt;/h3&gt;

&lt;p&gt;Prüfen Sie &lt;code&gt;finish_reason&lt;/code&gt;. Bei &lt;code&gt;length&lt;/code&gt; wurde die Ausgabelänge erreicht; das Modell hat nicht zwingend abgebrochen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Token-Nutzung prüfen
&lt;/h2&gt;

&lt;p&gt;Das &lt;code&gt;usage&lt;/code&gt;-Objekt ist die zuverlässigste Kostenquelle pro Aufruf:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;prompt_tokens&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completion_tokens&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Achten Sie auf &lt;code&gt;completion_tokens&lt;/code&gt;: Bei &lt;code&gt;reasoning_effort="max"&lt;/code&gt; werden Denk-Tokens als Ausgabe abgerechnet. Vergleichen Sie dieselben Prompts mit verschiedenen Aufwandstufen, bevor Sie einen Standard festlegen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preise
&lt;/h2&gt;

&lt;p&gt;Die Listenpreise betragen:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;0,15 $ pro Million Eingabe-Tokens&lt;/li&gt;
&lt;li&gt;0,50 $ pro Million Ausgabe-Tokens&lt;/li&gt;
&lt;li&gt;0,03 $ pro Million zwischengespeicherter Eingabe-Tokens&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Bis zum 9. September 2026 gilt ein Einführungsrabatt von 50 %:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;0,075 $ pro Million Eingabe-Tokens&lt;/li&gt;
&lt;li&gt;0,25 $ pro Million Ausgabe-Tokens&lt;/li&gt;
&lt;li&gt;0,015 $ pro Million zwischengespeicherter Eingabe-Tokens&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;OpenRouter, Cloudflare Workers AI, Vercel AI Gateway und DeepInfra können eigene Preise haben. Die &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisübersicht&lt;/a&gt; erklärt die Berechnung; prüfen Sie vor der Budgetplanung immer den Preis Ihres tatsächlichen Anbieters.&lt;/p&gt;

&lt;h2&gt;
  
  
  Integration testen
&lt;/h2&gt;

&lt;p&gt;Speichern Sie Text-, Bild- und Tool-Calling-Anfragen als Sammlung in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Hinterlegen Sie Assertions für die Antwortfelder, die Ihre Anwendung nutzt, und speichern Sie den API-Schlüssel als Umgebungsvariable.&lt;/p&gt;

&lt;p&gt;So können Sie bei einem Wechsel zwischen Flash und GLM-5.3 nur die Modell-ID ändern und dieselbe Testsuite erneut ausführen.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Wie lautet die genaue Modell-ID?
&lt;/h3&gt;

&lt;p&gt;Auf der Z.ai API: &lt;code&gt;glm-5.3-flash&lt;/code&gt;. Auf OpenRouter: &lt;code&gt;z-ai/glm-5.3-flash&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Funktioniert das OpenAI SDK ohne Änderungen?
&lt;/h3&gt;

&lt;p&gt;Ja — für Chat-Vervollständigungen, Streaming und Tool-Aufrufe. Nicht-Standard-Parameter wie &lt;code&gt;reasoning_effort&lt;/code&gt; benötigen im Python SDK &lt;code&gt;extra_body&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Wie viele Bilder kann ich senden?
&lt;/h3&gt;

&lt;p&gt;Mehrere, jeweils als eigener &lt;code&gt;image_url&lt;/code&gt;-Block. Die praktische Grenze bestimmt Ihr Kontextbudget, nicht eine feste Bildanzahl.&lt;/p&gt;

&lt;h3&gt;
  
  
  Warum sind Antworten ausführlich und langsam?
&lt;/h3&gt;

&lt;p&gt;&lt;code&gt;reasoning_effort&lt;/code&gt; steht standardmäßig auf &lt;code&gt;max&lt;/code&gt;. Setzen Sie für Aufgaben ohne umfangreiches Reasoning &lt;code&gt;low&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Wie hoch ist die maximale Ausgabelänge?
&lt;/h3&gt;

&lt;p&gt;Die Quellen widersprechen sich: OpenRouter nennt 131.072 Tokens, die Hugging-Face-Karte 163.840 Tokens. Prüfen Sie Ihren Anbieter, bevor Sie sich auf sehr lange Generierungen verlassen.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Wie man GLM-5.3-Flash in Claude Code und Cline verwendet</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:32:48 +0000</pubDate>
      <link>https://dev.to/emree_demir/wie-man-glm-53-flash-in-claude-code-und-cline-verwendet-14hp</link>
      <guid>https://dev.to/emree_demir/wie-man-glm-53-flash-in-claude-code-und-cline-verwendet-14hp</guid>
      <description>&lt;p&gt;Wenn Sie bereits den GLM Coding Plan abonniert haben, gibt es einen speziellen Grund, sich für GLM-5.3-Flash zu interessieren: Es soll im selben Plan die &lt;strong&gt;dreifache nutzbare Quote&lt;/strong&gt; von GLM-5.3 bieten. Der Tausch: dreimal so viele Anfragen für ein Modell mit 57 statt 60 Punkten im Artificial Analysis Intelligence Index.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog noch heute ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Für routinemäßige Codierungsarbeiten ist das oft sinnvoll. Dieser Leitfaden zeigt die Integration in Claude Code und Cline, sinnvolle Modellwahl und typische Konfigurationsfehler.&lt;/p&gt;

&lt;h2&gt;
  
  
  Voraussetzungen
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Ein GLM Coding Plan-Abonnement von &lt;a href="http://z.ai" rel="noopener noreferrer"&gt;z.ai&lt;/a&gt;, ab etwa 18 USD pro Monat.&lt;/li&gt;
&lt;li&gt;Ein API-Schlüssel aus dem &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Dashboard.&lt;/li&gt;
&lt;li&gt;Claude Code oder Cline.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Prüfen Sie Quotenmultiplikator und Planstufen direkt auf &lt;a href="http://z.ai" rel="noopener noreferrer"&gt;z.ai&lt;/a&gt;. Planbedingungen ändern sich häufiger als Modellspezifikationen; die 3x-Angabe stammt aus der &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Dokumentation.&lt;/p&gt;

&lt;h2&gt;
  
  
  Claude Code
&lt;/h2&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; stellt einen Anthropic-kompatiblen Endpunkt bereit. Claude Code benötigt dafür zwei Umgebungsvariablen.&lt;/p&gt;

&lt;h3&gt;
  
  
  Schnellstart
&lt;/h3&gt;

&lt;p&gt;Verwenden Sie den offiziellen Konfigurationshelfer:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;npx @z_ai/coding-helper
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Er fragt nach Ihrem Schlüssel und schreibt die Konfiguration. Wählen Sie anschließend &lt;code&gt;glm-5.3-flash&lt;/code&gt; als Modell.&lt;/p&gt;

&lt;h3&gt;
  
  
  Manuelle Konfiguration
&lt;/h3&gt;

&lt;p&gt;Setzen Sie URL und Token in Ihrem Shell-Profil:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;ANTHROPIC_BASE_URL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"https://api.z.ai/api/anthropic"&lt;/span&gt;
&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;ANTHROPIC_AUTH_TOKEN&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"your-z-ai-key"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Starten Sie Claude Code anschließend wie gewohnt. Anfragen gehen dann an &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; statt an Anthropic.&lt;/p&gt;

&lt;p&gt;Achten Sie besonders auf diese Punkte:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;ANTHROPIC_API_KEY&lt;/code&gt; ist nicht &lt;code&gt;ANTHROPIC_AUTH_TOKEN&lt;/code&gt;.&lt;/strong&gt; Entfernen Sie einen möglicherweise gesetzten alten Anthropic-Schlüssel. Wenn beide Variablen gesetzt sind, können irreführende Authentifizierungsfehler entstehen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Die Variablen müssen den gestarteten Prozess erreichen.&lt;/strong&gt; Wenn Sie Claude Code über einen Editor oder Launcher starten, wird Ihr Shell-Profil möglicherweise nicht geladen. Prüfen Sie im selben Startkontext:
&lt;/li&gt;
&lt;/ul&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;echo&lt;/span&gt; &lt;span class="nv"&gt;$ANTHROPIC_BASE_URL&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Modell und Timeout setzen
&lt;/h3&gt;

&lt;p&gt;Verwenden Sie diese Modell-ID:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"glm-5.3-flash"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Für lange Kontexte kann ein höheres Timeout nötig sein:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;API_TIMEOUT_MS&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;3000000
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Der Wert stammt aus einem GLM-5.2-Setup und sollte an Ihre Praxis angepasst werden. Der &lt;a href="https://apidog.com/de/blog/glm-5-2-claude-code-cline-cursor?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.2-Harness-Leitfaden&lt;/a&gt; hilft bei der Migration bestehender Konfigurationen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Cline
&lt;/h2&gt;

&lt;p&gt;Cline verwendet den OpenAI-kompatiblen Anbieter, nicht den Anthropic-kompatiblen Endpunkt.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Öffnen Sie die Cline-Einstellungen.&lt;/li&gt;
&lt;li&gt;Wählen Sie &lt;strong&gt;OpenAI Compatible&lt;/strong&gt; als API-Anbieter.&lt;/li&gt;
&lt;li&gt;Setzen Sie die Basis-URL auf &lt;code&gt;https://api.z.ai/api/coding/paas/v4&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Fügen Sie Ihren &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-API-Schlüssel ein.&lt;/li&gt;
&lt;li&gt;Wählen Sie ein benutzerdefiniertes Modell und tragen Sie &lt;code&gt;glm-5.3-flash&lt;/code&gt; ein.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Verwechseln Sie nicht die Endpunkte:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Coding Plan: &lt;code&gt;https://api.z.ai/api/coding/paas/v4&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Direkte API-Aufrufe: &lt;code&gt;https://api.z.ai/api/paas/v4&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Der Standard-API-Endpunkt wird beispielsweise im &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API-Leitfaden für GLM-5.3-Flash&lt;/a&gt; verwendet. Die Standard-URL mit einem Coding-Plan-Schlüssel ist eine häufige Ursache für Autorisierungsfehler. Prüfen Sie die aktuellen Pfade in der &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Dokumentation.&lt;/p&gt;

&lt;h3&gt;
  
  
  Kontextfenster konfigurieren
&lt;/h3&gt;

&lt;p&gt;Cline erkennt das Kontextfenster benutzerdefinierter Modelle nicht immer korrekt. Wenn Kontext zu früh verworfen wird, setzen Sie es manuell auf &lt;strong&gt;1.000.000&lt;/strong&gt;.&lt;/p&gt;

&lt;p&gt;Dieses Verhalten trat bereits bei GLM-5.2 auf: Cline verwirft Dateikontext früher als erwartet, obwohl das Modell ihn verarbeiten könnte.&lt;/p&gt;

&lt;h2&gt;
  
  
  Warum Flash für agentische Codierung?
&lt;/h2&gt;

&lt;p&gt;Nach den Startzahlen von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;GLM-5.3-Flash&lt;/th&gt;
&lt;th&gt;GLM-5.2&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Terminal-Bench 2.1&lt;/td&gt;
&lt;td&gt;84,3&lt;/td&gt;
&lt;td&gt;Nicht direkt vergleichbar&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSWE&lt;/td&gt;
&lt;td&gt;63,4&lt;/td&gt;
&lt;td&gt;46,2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;AutomationBench&lt;/td&gt;
&lt;td&gt;48,8&lt;/td&gt;
&lt;td&gt;26,2&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Der Terminal-Bench-Wert wurde mit Claude Code 2.1.207 gemessen und ist damit direkt für gängige Coding-Harnesses relevant. Behandeln Sie diese Werte als Herstellerangaben, bis unabhängige Reproduktionen vorliegen.&lt;/p&gt;

&lt;p&gt;Artificial Analysis misst einen Intelligence Index von &lt;strong&gt;57&lt;/strong&gt; für Flash gegenüber &lt;strong&gt;60&lt;/strong&gt; für GLM-5.3.&lt;/p&gt;

&lt;p&gt;Eine wichtige Neuerung für Coding-Harnesses ist die &lt;strong&gt;native Bildeingabe&lt;/strong&gt;. Flash kann Screenshots zusammen mit Code in derselben Anfrage verarbeiten. Bei Frontend-Problemen können Sie daher einen Screenshot eines fehlerhaften Layouts einfügen, statt das Rendering nur zu beschreiben. Der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vision-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Vision-Leitfaden&lt;/a&gt; behandelt diesen Pfad ausführlicher.&lt;/p&gt;

&lt;h2&gt;
  
  
  Geschwindigkeit versus Quote
&lt;/h2&gt;

&lt;p&gt;GLM-5.3-Flash erzeugt etwa &lt;strong&gt;49 Tokens pro Sekunde&lt;/strong&gt;; GLM-5.3 erreicht etwa &lt;strong&gt;86 Tokens pro Sekunde&lt;/strong&gt;. Bei langen Datei-Umschreibungen ist das spürbar.&lt;/p&gt;

&lt;p&gt;Die Zeit bis zum ersten Token ist mit 1,52 gegenüber 1,57 Sekunden nahezu gleich. Flash beginnt also ähnlich schnell zu antworten, ist aber bei langen Ausgaben deutlich langsamer.&lt;/p&gt;

&lt;p&gt;Der praktische Tausch lautet:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Dreifache Quote&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Etwa halbe Generierungsgeschwindigkeit&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Bei kleinen Änderungen, Tool-Aufrufen und iterativer Arbeit überwiegt meist die höhere Quote. Bei langen Neuschreibungen großer Dateien ist die Wartezeit real.&lt;/p&gt;

&lt;h2&gt;
  
  
  Praktische Routing-Strategie
&lt;/h2&gt;

&lt;p&gt;Nutzen Sie beide Modelle gezielt:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;GLM-5.3-Flash:&lt;/strong&gt; Erkundung, Code lesen, Befehle ausführen, kleine Änderungen und bildbezogene Aufgaben.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;GLM-5.3:&lt;/strong&gt; Schwierige Architekturentscheidungen, lange Refactorings und Aufgaben, bei denen Flash bereits gescheitert ist.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Das Umschalten kostet nur die Änderung der Modell-ID in Ihren Harness-Einstellungen. So bleibt der Großteil des Volumens beim 3x-Quoten-Modell, während die teurere Quote für anspruchsvolle Aufgaben reserviert bleibt.&lt;/p&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; weist außerdem darauf hin, dass Aufrufe außerhalb der Spitzenzeiten nur die Hälfte der Standardpunkte verbrauchen. Batch- und Hintergrund-Agentenarbeit außerhalb dieser Zeiten kann den Plan weiter strecken.&lt;/p&gt;

&lt;h2&gt;
  
  
  Fehlerbehebung
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;401 oder 403 bei jeder Anfrage:&lt;/strong&gt; Meist ist die Basis-URL nicht zum Schlüssel passend, oder ein alter &lt;code&gt;ANTHROPIC_API_KEY&lt;/code&gt; überschattet &lt;code&gt;ANTHROPIC_AUTH_TOKEN&lt;/code&gt;. Testen Sie zuerst den direkten Aufruf weiter unten.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Modell nicht gefunden:&lt;/strong&gt; Die korrekte native &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-ID lautet &lt;code&gt;glm-5.3-flash&lt;/code&gt;. Bei OpenRouter heißt das Modell &lt;code&gt;z-ai/glm-5.3-flash&lt;/code&gt;; diese IDs sind nicht austauschbar.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Kontext wird zu früh abgeschnitten:&lt;/strong&gt; Setzen Sie in Cline das Kontextfenster manuell auf &lt;strong&gt;1.000.000&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Timeouts bei großen Anfragen:&lt;/strong&gt; Erhöhen Sie &lt;code&gt;API_TIMEOUT_MS&lt;/code&gt;. Sehr lange Kontextanfragen können Client-Timeouts überschreiten, ohne dass ein Fehler beim Modell vorliegt.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Quote schneller verbraucht als erwartet:&lt;/strong&gt; &lt;code&gt;reasoning_effort&lt;/code&gt; steht standardmäßig auf &lt;code&gt;max&lt;/code&gt;, und Reasoning-Tokens zählen zur Quote. Senken Sie den Wert für Routineaufgaben auf &lt;code&gt;low&lt;/code&gt;, sofern Ihr Harness dies unterstützt.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Fehlerhafte Tool-Aufrufe:&lt;/strong&gt; Prüfen Sie, ob Harness und Endpunkt dasselbe Tool-Calling-Format erwarten. Dieser Teil ist versionssensitiv und kann nach Updates auf beiden Seiten brechen.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Weitere Harnesses
&lt;/h2&gt;

&lt;p&gt;Die zwei Verbindungstypen decken die meisten Tools ab:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Anthropic-kompatible Tools&lt;/strong&gt; wie Claude Code und einige Agenten-Frameworks:

&lt;ul&gt;
&lt;li&gt;URL: &lt;code&gt;https://api.z.ai/api/anthropic&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;[REDACTED CREDENTIAL]_TOKEN`&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;OpenAI-kompatible Tools&lt;/strong&gt; wie Cline, Roo, Kilo, OpenCode, Codex und Cursors benutzerdefinierte Modelloption:

&lt;ul&gt;
&lt;li&gt;URL: &lt;code&gt;https://api.z.ai/api/coding/paas/v4&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Modell: &lt;code&gt;glm-5.3-flash&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Schlüssel: Standardfeld für API-Schlüssel&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Weitere Beispiele finden Sie in den Leitfäden zu &lt;a href="https://apidog.com/de/blog/glm-5-1-claude-code?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5.1 mit Claude Code&lt;/a&gt; sowie &lt;a href="https://apidog.com/de/blog/claude-code-cursor-glm-4-7?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Claude Code und Cursor mit GLM-4.7&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Verbindung prüfen
&lt;/h2&gt;

&lt;p&gt;Prüfen Sie den Endpunkt unabhängig vom Harness:&lt;/p&gt;

&lt;p&gt;&lt;code&gt;&lt;/code&gt;&lt;code&gt;bash&lt;br&gt;
curl https://api.z.ai/api/coding/paas/v4/chat/completions \&lt;br&gt;
  -H "[REDACTED CREDENTIAL] $ZAI_API_KEY" \&lt;br&gt;
  -H "Content-Type: application/json" \&lt;br&gt;
  -d '{&lt;br&gt;
    "model": "glm-5.3-flash",&lt;br&gt;
    "messages": [{"role": "user", "content": "reply with OK"}]&lt;br&gt;
  }'&lt;br&gt;
&lt;/code&gt;&lt;code&gt;&lt;/code&gt;&lt;/p&gt;

&lt;p&gt;Wenn dieser Aufruf eine Vervollständigung zurückgibt, Ihr Harness aber weiter fehlschlägt, liegt das Problem in der Harness-Konfiguration und nicht an den Zugangsdaten.&lt;/p&gt;

&lt;p&gt;Für wiederholte Tests ist &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; praktischer als die Shell-Historie. Speichern Sie Coding- und Standard-Endpunkt nebeneinander, hinterlegen Sie den Schlüssel als Umgebungsvariable und prüfen Sie bei Autorisierungsfehlern mit einem Klick, ob Endpunkt oder Tool verantwortlich ist.&lt;/p&gt;

&lt;h2&gt;
  
  
  Häufig gestellte Fragen
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Benötige ich einen Coding Plan oder funktionieren API-Credits?&lt;/strong&gt; Beides funktioniert. Der Coding Plan ist für täglich codierende Entwickler meist günstiger; getakteter API-Zugang eignet sich für Anwendungen. Der &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preisleitfaden&lt;/a&gt; vergleicht beide Optionen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Hat Flash wirklich die dreifache Quote von GLM-5.3?&lt;/strong&gt; Das ist die von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; angegebene Zahl. Prüfen Sie sie vor der Planung auf &lt;a href="http://z.ai/subscribe" rel="noopener noreferrer"&gt;z.ai/subscribe&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Warum schneidet Cline meinen Kontext ab?&lt;/strong&gt; Setzen Sie das Kontextfenster manuell auf &lt;strong&gt;1.000.000&lt;/strong&gt;; Cline erkennt dies bei benutzerdefinierten Modellen nicht immer.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Welche Basis-URL brauche ich?&lt;/strong&gt; &lt;code&gt;https://api.z.ai/api/anthropic&lt;/code&gt; für Claude Code, &lt;code&gt;https://api.z.ai/api/coding/paas/v4&lt;/code&gt; für OpenAI-kompatible Tools im Coding Plan und &lt;code&gt;https://api.z.ai/api/paas/v4&lt;/code&gt; für direkte API-Aufrufe.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Kann ich Screenshots in Claude Code mit Flash verwenden?&lt;/strong&gt; Das Modell unterstützt native Bildeingabe. Ob Ihre Harness-Version sie verfügbar macht, müssen Sie vor dem Einsatz testen.&lt;/li&gt;
&lt;/ul&gt;

</description>
    </item>
    <item>
      <title>GLM-5.3-Flash API in Apidog testen: Eine Anleitung</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:30:27 +0000</pubDate>
      <link>https://dev.to/emree_demir/glm-53-flash-api-in-apidog-testen-eine-anleitung-4n8h</link>
      <guid>https://dev.to/emree_demir/glm-53-flash-api-in-apidog-testen-eine-anleitung-4n8h</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.3-Flash mit Apidog testen: Text, Vision und Tool-Calling
&lt;/h1&gt;

&lt;p&gt;Das Austauschen eines LLM ist technisch oft eine Änderung in einer Zeile, operativ aber ein deutlich größeres Risiko. Die Modell-ID ist nur eine Zeichenfolge – sie beeinflusst jedoch Latenz, Token-Kosten, Ausgabeformat, Tool-Calling und die Unterstützung von Bildern.&lt;/p&gt;

&lt;p&gt;GLM-5.3-Flash macht diese Trade-offs sichtbar: Das Modell ist ungefähr neunmal günstiger als GLM-5.3, verarbeitet Bilder nativ und generiert etwa halb so schnell. Welche Variante für Ihre Anwendung besser ist, zeigt nur ein Test mit Ihren eigenen Anfragen.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Apidog heute ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Dieser Leitfaden erstellt eine wiederverwendbare Testsammlung für die GLM-5.3-Flash-API in &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Sie deckt Text- und Bildaufrufe, Tool-Calling, Assertions sowie den Vergleich mit dem größeren Modell ab.&lt;/p&gt;

&lt;h2&gt;
  
  
  Warum nicht einfach curl?
&lt;/h2&gt;

&lt;p&gt;Sie können den Endpunkt mit curl testen; &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;unser API-Leitfaden&lt;/a&gt; zeigt den grundlegenden Aufruf. Für wiederholbare Tests stößt curl jedoch schnell an Grenzen:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Base64-Bilder:&lt;/strong&gt; Eine Daten-URL für einen Screenshot ist Tausende Zeichen lang und im Terminal kaum lesbar oder wiederverwendbar.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Keine Validierung:&lt;/strong&gt; Eine Curl-Antwort zeigt, dass der Aufruf erfolgreich war – nicht, ob die Felder noch vorhanden sind, die Ihre Anwendung tatsächlich verwendet.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Eine gespeicherte Sammlung hält Payloads lesbar und führt Assertions bei jedem Lauf aus.&lt;/p&gt;

&lt;h2&gt;
  
  
  Umgebung einrichten
&lt;/h2&gt;

&lt;p&gt;Erstellen Sie eine Umgebung mit den Werten, die sich zwischen Testläufen ändern. Lassen Sie die Modell-ID variabel, damit Sie später die komplette Sammlung gegen ein anderes Modell ausführen können.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Variable&lt;/th&gt;
&lt;th&gt;Wert&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;base_url&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;https://api.z.ai/api/paas/v4&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;api_key&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Ihr &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Schlüssel&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;model&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;glm-5.3-flash&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;test_image_url&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Öffentlich erreichbare URL zu einem bekannten Testbild&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Speichern Sie den API-Schlüssel als Umgebungsvariable statt direkt im Header. So gelangt er nicht versehentlich in exportierte Sammlungen oder in die Versionsverwaltung.&lt;/p&gt;

&lt;h2&gt;
  
  
  Anfrage 1: Textvervollständigung
&lt;/h2&gt;

&lt;p&gt;Erstellen Sie eine POST-Anfrage an &lt;code&gt;{{base_url}}/chat/completions&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Header:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;[REDACTED CREDENTIAL] {{api_key}}
Content-Type: application/json
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Body:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{model}}"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"messages"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;"role"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"user"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nl"&gt;"content"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"Reply with exactly: OK"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"reasoning_effort"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"low"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Setzen Sie &lt;code&gt;reasoning_effort&lt;/code&gt; für den Konnektivitätstest auf &lt;code&gt;low&lt;/code&gt;. Beim Modell ist standardmäßig &lt;code&gt;max&lt;/code&gt; eingestellt; die zusätzlichen Reasoning-Tokens wären für diesen einfachen Test unnötig.&lt;/p&gt;

&lt;p&gt;Empfohlene Assertions:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Statuscode ist &lt;code&gt;200&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;choices[0].message.content&lt;/code&gt; existiert&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;choices[0].finish_reason&lt;/code&gt; ist &lt;code&gt;stop&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;usage.total_tokens&lt;/code&gt; existiert&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die &lt;code&gt;finish_reason&lt;/code&gt;-Assertion erkennt abgeschnittene Antworten. &lt;code&gt;length&lt;/code&gt; bedeutet, dass die Ausgabe am Limit beendet wurde und möglicherweise unvollständig ist.&lt;/p&gt;

&lt;h2&gt;
  
  
  Anfrage 2: Bildaufruf
&lt;/h2&gt;

&lt;p&gt;Der Vision-Test rechtfertigt den Aufbau einer gespeicherten Sammlung besonders deutlich. GLM-5.3-Flash akzeptiert Bilder nativ, GLM-5.3 nicht.&lt;/p&gt;

&lt;p&gt;Verwenden Sie denselben Endpunkt, aber ein typisiertes &lt;code&gt;content&lt;/code&gt;-Array:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{model}}"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"messages"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"role"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"user"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"content"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"text"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"text"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"What color is the dominant shape in this image? Answer with one word."&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"image_url"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"image_url"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
            &lt;/span&gt;&lt;span class="nl"&gt;"url"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{test_image_url}}"&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"reasoning_effort"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"low"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Verweisen Sie mit &lt;code&gt;test_image_url&lt;/code&gt; auf ein stabiles, öffentlich erreichbares Bild, dessen richtige Antwort bekannt ist. Eine deterministische Frage macht aus der Demo einen Regressionstest.&lt;/p&gt;

&lt;p&gt;Für lokale Bilder können Sie eine Base64-Daten-URL verwenden:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;data:image/png;base64,iVBORw0Ggo...
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Speichern Sie auch diese URL als Umgebungsvariable, damit der Body lesbar bleibt.&lt;/p&gt;

&lt;p&gt;Assertions:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Statuscode ist &lt;code&gt;200&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;choices[0].message.content&lt;/code&gt; enthält die bekannte Antwort&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;usage.prompt_tokens&lt;/code&gt; ist größer als bei der reinen Textanfrage&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Bilder verbrauchen Eingabe-Tokens. Steigt die Anzahl der Prompt-Tokens nicht, wurde das Bild wahrscheinlich nicht verarbeitet – obwohl der HTTP-Aufruf erfolgreich war.&lt;/p&gt;

&lt;p&gt;Weitere Details zum Vision-Pfad und seinen Fehlermodi finden Sie in &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vision-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;unserem GLM-5.3-Flash-Vision-Leitfaden&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Anfrage 3: Tool-Calling
&lt;/h2&gt;

&lt;p&gt;Wenn Ihre Anwendung Funktionsaufrufe verwendet, testen Sie das Format explizit. Tool-Calling reagiert besonders empfindlich auf Modell- und Provideränderungen.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{model}}"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"messages"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;"role"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"user"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="nl"&gt;"content"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"Is the checkout-api service healthy?"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"tools"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"function"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"function"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="nl"&gt;"name"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"get_deployment_status"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="nl"&gt;"description"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"Returns the current status of a named deployment."&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="nl"&gt;"parameters"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"object"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"properties"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
            &lt;/span&gt;&lt;span class="nl"&gt;"service"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
              &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"string"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
              &lt;/span&gt;&lt;span class="nl"&gt;"description"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"The service name."&lt;/span&gt;&lt;span class="w"&gt;
            &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
          &lt;/span&gt;&lt;span class="nl"&gt;"required"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s2"&gt;"service"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Assertions:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;choices[0].message.tool_calls&lt;/code&gt; existiert und ist nicht leer&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;choices[0].message.tool_calls[0].function.name&lt;/code&gt; ist &lt;code&gt;get_deployment_status&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;choices[0].finish_reason&lt;/code&gt; ist &lt;code&gt;tool_calls&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Prüfen Sie nicht nur, ob ein Tool aufgerufen wurde, sondern auch den Funktionsnamen. So erkennen Sie, wenn das Modell das falsche Tool auswählt.&lt;/p&gt;

&lt;p&gt;Wenn Sie Tool-Definitionen aus einer vorhandenen API generieren, hilft &lt;a href="https://apidog.com/de/blog/openapi-spec-as-agent-tools?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;die Umwandlung einer OpenAPI-Spezifikation in Agenten-Tools&lt;/a&gt;, manuelle Schemas zu vermeiden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Vergleich mit GLM-5.3
&lt;/h2&gt;

&lt;p&gt;Duplizieren Sie Ihre Umgebung, setzen Sie &lt;code&gt;model&lt;/code&gt; auf &lt;code&gt;glm-5.3&lt;/code&gt; und führen Sie dieselbe Sammlung erneut aus.&lt;/p&gt;

&lt;p&gt;Vergleichen Sie:&lt;/p&gt;

&lt;h3&gt;
  
  
  Korrektheit
&lt;/h3&gt;

&lt;p&gt;Bestehen die Assertions weiterhin? Die Bildanfrage wird erwartungsgemäß fehlschlagen, weil GLM-5.3 Bilder nicht nativ verarbeitet. Das ist ein relevantes Testergebnis und kein fehlerhafter Test.&lt;/p&gt;

&lt;h3&gt;
  
  
  Latenz
&lt;/h3&gt;

&lt;p&gt;Apidog zeigt die Antwortzeit pro Anfrage. Bei längeren Ausgaben sollte GLM-5.3 schneller fertig werden: ungefähr 86 Tokens pro Sekunde gegenüber 49 bei Flash.&lt;/p&gt;

&lt;h3&gt;
  
  
  Kosten
&lt;/h3&gt;

&lt;p&gt;Das &lt;code&gt;usage&lt;/code&gt;-Objekt enthält &lt;code&gt;prompt_tokens&lt;/code&gt; und &lt;code&gt;completion_tokens&lt;/code&gt;. Multiplizieren Sie diese Werte mit den jeweiligen Modellpreisen, um die tatsächlichen Kosten pro Anfrage zu berechnen.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Unsere Preisübersicht&lt;/a&gt; enthält die aktuellen Raten. &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-vs-glm-5-3?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Der vollständige Modellvergleich&lt;/a&gt; zeigt, in welchen Szenarien welches Modell besser abschneidet.&lt;/p&gt;

&lt;p&gt;Achten Sie außerdem auf &lt;code&gt;completion_tokens&lt;/code&gt; bei verschiedenen &lt;code&gt;reasoning_effort&lt;/code&gt;-Einstellungen. Bei &lt;code&gt;max&lt;/code&gt; werden Reasoning-Tokens als Ausgabe abgerechnet. Führen Sie denselben Prompt mit &lt;code&gt;low&lt;/code&gt;, &lt;code&gt;high&lt;/code&gt; und &lt;code&gt;max&lt;/code&gt; aus und vergleichen Sie die Token-Anzahlen mit der tatsächlichen Qualität.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lokale Bereitstellung testen
&lt;/h2&gt;

&lt;p&gt;Wenn Sie die Gewichte selbst hosten, stellen vLLM und SGLang OpenAI-kompatible Endpunkte bereit. Ändern Sie &lt;code&gt;base_url&lt;/code&gt; auf Ihren Server und führen Sie die unveränderte Sammlung erneut aus.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F76hcvpe5zwrqnnncr0kd.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F76hcvpe5zwrqnnncr0kd.png" width="799" height="530"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Das ist einer der wertvollsten Einsatzzwecke der Testsuite. Ein quantisiertes Build kann den Chat-Smoke-Test bestehen und trotzdem Tool-Schemas falsch verarbeiten oder bei Bildeingaben degenerieren. &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-locally?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Unser Leitfaden zur lokalen Ausführung&lt;/a&gt; behandelt die Bereitstellung.&lt;/p&gt;

&lt;h2&gt;
  
  
  In CI integrieren
&lt;/h2&gt;

&lt;p&gt;Sobald die Sammlung stabil ist, führen Sie sie nach Zeitplan oder in Ihrer Pipeline aus:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Vor einer Modellmigration:&lt;/strong&gt; als Freigabe- oder Ablehnungssignal&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Nach Zeitplan:&lt;/strong&gt; um Änderungen beim Provider zu erkennen&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Nach Abhängigkeits-Updates:&lt;/strong&gt; da SDK-Änderungen die Request-Serialisierung beeinflussen können&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Provider aktualisieren Modelle teilweise hinter stabilen Modell-IDs. Geplante Tests zeigen Verhaltensänderungen, bevor sie von Benutzerinnen und Benutzern gemeldet werden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Tests über den Happy Path hinaus
&lt;/h2&gt;

&lt;p&gt;Erweitern Sie die Sammlung anschließend um:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;langen Kontext in der tatsächlich verwendeten Größenordnung&lt;/li&gt;
&lt;li&gt;fehlerhafte Eingaben und die erwarteten Fehlerantworten&lt;/li&gt;
&lt;li&gt;Ratenbegrenzungsantworten zur Prüfung der Wiederholungslogik&lt;/li&gt;
&lt;li&gt;mehrere Bilder, sofern Ihre Anwendung sie unterstützt&lt;/li&gt;
&lt;li&gt;Streaming, da sich die Antwortstruktur vom Standardaufruf unterscheidet&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Zusammenfassung
&lt;/h2&gt;

&lt;p&gt;Der eigentliche Wert liegt nicht in den drei einzelnen Anfragen, sondern in ihrer Wiederholbarkeit. Eine Modellwahl, die Sie in dreißig Sekunden erneut testen können, bleibt überprüfbar, wenn sich Preise ändern, &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; eine neue Revision veröffentlicht oder ein Providerwechsel ansteht.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; kann kostenlos gestartet werden. Der Import eines OpenAI-kompatiblen Schemas übernimmt außerdem einen großen Teil der Einrichtung.&lt;/p&gt;

&lt;p&gt;So wird der nächste Modellwechsel zu einem messbaren Vergleich statt zu einem Sprung ins Ungewisse.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Benötige ich einen kostenpflichtigen Apidog-Plan?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Nein. Umgebungsvariablen und Assertions funktionieren auch im kostenlosen Tarif.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wie teste ich Base64-Bilder, ohne den Request unleserlich zu machen?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Speichern Sie die Daten-URL als Umgebungsvariable und referenzieren Sie sie im Body mit &lt;code&gt;{{test_image_url}}&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kann ich den Coding-Plan-Endpunkt genauso testen?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Ja. Setzen Sie &lt;code&gt;base_url&lt;/code&gt; auf &lt;code&gt;https://api.z.ai/api/coding/paas/v4&lt;/code&gt;. Dieser Endpunkt unterscheidet sich vom Standard-API-Endpunkt, wie in &lt;a href="https://apidog.com/de/blog/glm-5-3-flash-claude-code-cline?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;unserem Claude-Code- und-Cline-Leitfaden&lt;/a&gt; beschrieben.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Funktionieren diese Tests auch mit anderen Anbietern?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Meistens. OpenRouter, Cloudflare Workers AI und Vercel AI Gateway bieten OpenAI-kompatible Schnittstellen. Ändern Sie &lt;code&gt;base_url&lt;/code&gt; und den Modell-ID-Namespace.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Wie prüfe ich nicht-deterministische Antworten?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Prüfen Sie Struktur und Einschränkungen statt exakten Text: Feldpräsenz, Datentypen, Token-Anzahlen, &lt;code&gt;finish_reason&lt;/code&gt; und das Vorkommen erwarteter Teilzeichenfolgen.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Wie man GLM-5.3-Flash lokal ausführt</title>
      <dc:creator>Emre Demir</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:29:04 +0000</pubDate>
      <link>https://dev.to/emree_demir/wie-man-glm-53-flash-lokal-ausfuhrt-113g</link>
      <guid>https://dev.to/emree_demir/wie-man-glm-53-flash-lokal-ausfuhrt-113g</guid>
      <description>&lt;p&gt;GLM-5.3-Flash ist ein Modell mit 320 Milliarden Parametern und MIT-Lizenz. Sie dürfen es frei ausführen, benötigen dafür aber entsprechende Hardware.&lt;/p&gt;

&lt;p&gt;Interessant ist die Kombination aus 18 Milliarden aktiven Parametern pro Token und verfügbaren Quantisierungen. Dadurch ist das Modell auch auf Hardware unterhalb eines 8x-H200-Knotens einsetzbar.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Jetzt Apidog ausprobieren&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Dieser Beitrag vergleicht die Hardware-Anforderungen – vom Full-Precision-Produktionsknoten bis zum quantisierten Workstation-Setup – und zeigt, wann Self-Hosting sinnvoll ist.&lt;/p&gt;

&lt;h2&gt;
  
  
  Was Sie tatsächlich laden
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Eigenschaft&lt;/th&gt;
&lt;th&gt;Wert&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gesamtparameter&lt;/td&gt;
&lt;td&gt;320B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Pro Token aktiv&lt;/td&gt;
&lt;td&gt;18B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Architektur&lt;/td&gt;
&lt;td&gt;MoE, hybride lineare und Sparse-Attention&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kontext&lt;/td&gt;
&lt;td&gt;1.048.576 Tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lizenz&lt;/td&gt;
&lt;td&gt;MIT&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gewichte&lt;/td&gt;
&lt;td&gt;&lt;code&gt;zai-org/GLM-5.3-Flash&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GGUF-Quantisierungen&lt;/td&gt;
&lt;td&gt;&lt;code&gt;unsloth/GLM-5.3-Flash-GGUF&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Das Mixture-of-Experts-Design reduziert den Rechenaufwand: Alle 320 Milliarden Parameter müssen im Speicher liegen, aber nur 18 Milliarden werden pro Token aktiviert. Die entscheidende Ressource ist daher der Speicher, nicht die FLOPS.&lt;/p&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; gibt außerdem an, dass der KV-Cache etwa 4,4-mal kleiner als bei GLM-5.3 ist. Das ist bei langen Kontexten wichtig, denn der KV-Cache wächst mit dem Kontext und kann bei einem 1M-Token-Fenster zum eigentlichen Engpass werden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Stufe 1: Volle Präzision auf einem Produktionsknoten
&lt;/h2&gt;

&lt;p&gt;Für Full-Precision-Betrieb mit echter Parallelität ist ein &lt;strong&gt;8x-H200-Knoten&lt;/strong&gt; die Referenzkonfiguration. Jede H200 bietet 141 GB, insgesamt also etwa 1.128 GB. Ein 8x-H20-Knoten funktioniert ebenfalls.&lt;/p&gt;

&lt;p&gt;Die Gewichte benötigen je nach Präzision grob 700 bis 800 GB. Zusätzlich brauchen Sie Speicher für KV-Cache und Laufzeit-Overhead. Ein gemieteter Knoten dieser Größe kostet etwa 24 bis 48 US-Dollar pro Tag.&lt;/p&gt;

&lt;h3&gt;
  
  
  vLLM
&lt;/h3&gt;

&lt;p&gt;vLLM bietet derzeit die breiteste Ökosystemunterstützung. Verwenden Sie für die Tensor-Parallelität eine Zweierpotenz:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;vllm serve zai-org/GLM-5.3-Flash &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--tensor-parallel-size&lt;/span&gt; 8 &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--max-model-len&lt;/span&gt; 1048576 &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--trust-remote-code&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Validieren Sie das Setup zunächst mit einem kleineren &lt;code&gt;--max-model-len&lt;/code&gt;. Das vollständige Million-Token-Fenster reserviert sofort einen großen KV-Cache. Ein Fehlschlag sieht dann leicht wie ein Out-of-Memory-Problem statt wie eine falsche Konfiguration aus.&lt;/p&gt;

&lt;h3&gt;
  
  
  SGLang
&lt;/h3&gt;

&lt;p&gt;SGLang bot Day-Zero-Unterstützung für das Modell und veröffentlichte Rezepte für H100, H200, B200, B300 und GB200, einschließlich multimodaler Bereitstellung. &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; nutzte für den eigenen Pre-Launch-Betrieb einen SGLang-basierten Stack.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;python &lt;span class="nt"&gt;-m&lt;/span&gt; sglang.launch_server &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--model-path&lt;/span&gt; zai-org/GLM-5.3-Flash &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--tp&lt;/span&gt; 8 &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--context-length&lt;/span&gt; 1048576
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;SGLang ist häufig bei strukturierten Ausgaben und hochparallelen agentenbasierten Workloads im Vorteil. Für einen Code-Agenten sollten Sie SGLang gegen vLLM benchmarken, statt die Standardwahl zu übernehmen.&lt;/p&gt;

&lt;p&gt;Beide Stacks benötigen einen konfigurierten Tool-Call-Parser. Prüfen Sie die aktuellen Flags in der jeweiligen Dokumentation, da sich Parsernamen zwischen Releases ändern.&lt;/p&gt;

&lt;h2&gt;
  
  
  Stufe 2: Quantisierung auf kleinerer Hardware
&lt;/h2&gt;

&lt;p&gt;Quantisierte GGUF-Builds werden unter &lt;code&gt;unsloth/GLM-5.3-Flash-GGUF&lt;/code&gt; veröffentlicht, einschließlich aggressiver 1-Bit- und 2-Bit-Formate wie IQ1_S und IQ2_XXS.&lt;/p&gt;

&lt;p&gt;Eine 2-Bit-Quantisierung reduziert den Speicherbedarf eines 320B-Modells so weit, dass eine Workstation mit viel RAM oder ein Multi-GPU-Consumer-Rig infrage kommt. CPU-Offload erweitert die Möglichkeiten zusätzlich.&lt;/p&gt;

&lt;p&gt;Beachten Sie zwei Einschränkungen:&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Aggressive Quantisierung kostet Qualität.&lt;/strong&gt; IQ1_S liegt deutlich unter Full Precision. Bei einem 320B-MoE kann der Qualitätsverlust durch die zusätzliche Redundanz oft geringer ausfallen als bei einem dichten Modell. Trotzdem sind „läuft“ und „läuft gut“ verschiedene Aussagen. Testen Sie das Format mit Ihren realen Aufgaben.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Die Unsloth-Dokumentation ist als Work-in-Progress gekennzeichnet.&lt;/strong&gt; Verfügbarkeit und empfohlene Einstellungen können sich ändern. Prüfen Sie vor der Planung, welche Builds tatsächlich veröffentlicht sind.&lt;/p&gt;

&lt;p&gt;Für CPU-intensive und hybride Setups ist &lt;strong&gt;KTransformers&lt;/strong&gt; geeignet. Die Laufzeit hält MoE-Experten im System-RAM und verschiebt nur notwendige Teile auf die GPU. Das passt besonders gut zu einem MoE-Modell mit 18 Milliarden aktiven Parametern. &lt;strong&gt;TokenSpeed&lt;/strong&gt; wird ebenfalls als unterstützte Laufzeit aufgeführt.&lt;/p&gt;

&lt;p&gt;Die Anleitung zum &lt;a href="https://apidog.com/de/blog/glm-4-7-flash-locally?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;lokalen Ausführen von GLM-4.7-Flash&lt;/a&gt; behandelt die kleinere Modellversion dieses Workflows. &lt;a href="https://apidog.com/de/blog/run-glm-5-locally-for-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GLM-5 kostenlos lokal ausführen&lt;/a&gt; erklärt das allgemeine lokale GLM-Setup.&lt;/p&gt;

&lt;h2&gt;
  
  
  Ihr Speicherbudget berechnen
&lt;/h2&gt;

&lt;p&gt;Zwei Werte entscheiden, ob Ihre Konfiguration passt.&lt;/p&gt;

&lt;h3&gt;
  
  
  Gewichte
&lt;/h3&gt;

&lt;p&gt;Bei etwa 2 Bytes pro Parameter in BF16 benötigen 320 Milliarden Parameter rund 640 GB vor Overhead. FP8 halbiert diesen Wert ungefähr. Eine 4-Bit-Quantisierung reduziert den Bedarf auf etwa 160 GB; 2-Bit-Formate gehen noch weiter herunter, verursachen aber deutlichere Qualitätseinbußen.&lt;/p&gt;

&lt;h3&gt;
  
  
  KV-Cache
&lt;/h3&gt;

&lt;p&gt;Der KV-Cache skaliert mit Kontextlänge und Parallelität. Eine Konfiguration, die bei 8K Kontext funktioniert, kann bei 128K scheitern, weil der Cache wächst – nicht die Gewichte.&lt;/p&gt;

&lt;p&gt;Die von &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; gemeldete Reduzierung um den Faktor 4,4 gegenüber GLM-5.3 hilft, die Skalierung bleibt jedoch linear zur Token-Anzahl.&lt;/p&gt;

&lt;p&gt;Dimensionieren Sie daher für die tatsächlich benötigte Kontextlänge, nicht für das beworbene Maximum. Nur wenige Anwendungen benötigen eine Million Tokens. Ein unnötig großes Kontextfenster ist der häufigste Grund, warum das Modell unbezahlbar wirkt.&lt;/p&gt;

&lt;p&gt;Falls Sie die Open-Weights-Entwicklung dieser Modellfamilie verfolgt haben: &lt;a href="https://apidog.com/de/blog/self-host-glm-5-3-open-weights?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Unser Beitrag zum Self-Hosting von GLM-5.3&lt;/a&gt; wurde vor der Veröffentlichung geschrieben. GLM-5.3-Flash ist inzwischen unter MIT veröffentlicht; die vorliegende Anleitung ersetzt daher die frühere Einschätzung.&lt;/p&gt;

&lt;h2&gt;
  
  
  Feinabstimmung
&lt;/h2&gt;

&lt;p&gt;Die MIT-Lizenz erlaubt Feinabstimmung und Weiterverteilung. Bei einem Modell dieser Leistungsklasse ist das der stärkste Grund, die Gewichte selbst zu betreiben.&lt;/p&gt;

&lt;p&gt;Eine vollständige Feinabstimmung eines 320B-Modells ist für die meisten Teams nicht realistisch. Parametereffiziente Verfahren wie LoRA sind der praktikable Ansatz. Bei einem MoE-Modell kommt außerdem die Designentscheidung hinzu, ob Sie Router, Experten oder Attention-Layer anpassen. Dafür gibt es weniger etablierte Richtlinien als bei dichten Modellen.&lt;/p&gt;

&lt;p&gt;Geht es nur um Domänenanpassung, testen Sie zuerst Prompting und Retrieval mit dem Basismodell. Bei einem Kontextfenster von einer Million Tokens ist es häufig günstiger und effektiver, Domänenwissen in den Prompt einzubinden, statt es zu trainieren.&lt;/p&gt;

&lt;h2&gt;
  
  
  Sampling-Einstellungen
&lt;/h2&gt;

&lt;p&gt;&lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; empfiehlt folgende Werte:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Anwendungsfall&lt;/th&gt;
&lt;th&gt;Temperatur&lt;/th&gt;
&lt;th&gt;&lt;code&gt;top_p&lt;/code&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Allgemein&lt;/td&gt;
&lt;td&gt;1.0&lt;/td&gt;
&lt;td&gt;0.95&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kodieren&lt;/td&gt;
&lt;td&gt;0.95&lt;/td&gt;
&lt;td&gt;1.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Das Modell unterstützt drei Denkmodi über &lt;code&gt;reasoning_effort&lt;/code&gt;:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;low&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;high&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;max&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;&lt;code&gt;max&lt;/code&gt; ist der Standard.&lt;/strong&gt; Auf lokaler Hardware sind diese Einstellungen besonders relevant, weil Denk-Tokens zusätzliche Generierungszeit statt zusätzlicher API-Kosten verursachen. Bei langsamer Hardware kann &lt;code&gt;low&lt;/code&gt; den Unterschied zwischen nutzbar und unbrauchbar ausmachen.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lohnt sich Self-Hosting finanziell?
&lt;/h2&gt;

&lt;p&gt;Meistens nicht. Der API-Preis ist dafür ausschlaggebend.&lt;/p&gt;

&lt;p&gt;Zu Listenpreisen kostet GLM-5.3-Flash 0,15 US-Dollar pro Million Eingabetokens. Ein gemieteter 8x-H200-Knoten für etwa 1.000 US-Dollar pro Monat entspricht ungefähr 6,7 Milliarden Eingabetokens über die API.&lt;/p&gt;

&lt;p&gt;Ein eigener Knoten verursacht Fixkosten – unabhängig davon, ob er ausgelastet ist. Die API berechnet dagegen nur die tatsächliche Nutzung. Bei fehlender konstant hoher Auslastung ist die API daher meist günstiger.&lt;/p&gt;

&lt;p&gt;Die wichtigsten Gründe für Self-Hosting sind:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Datenresidenz und Datenschutz:&lt;/strong&gt; Ihre Daten verlassen die Infrastruktur nicht.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Keine Ratenbegrenzungen:&lt;/strong&gt; Ihre verfügbare Kapazität gehört Ihnen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Verfügbarkeitsgarantien:&lt;/strong&gt; Sie hängen nicht von der Verfügbarkeit oder Preispolitik eines Anbieters ab.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;MIT-Lizenz:&lt;/strong&gt; Sie können das Modell ändern, feinabstimmen und weiterverteilen.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Bereits vorhandene Hardware:&lt;/strong&gt; Bei gekauften, ungenutzten GPUs sind die Grenzkosten auf Strom begrenzt.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;a href="https://apidog.com/de/blog/glm-5-3-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Unsere Preisanalyse&lt;/a&gt; vergleicht die API-Kosten ausführlicher.&lt;/p&gt;

&lt;h2&gt;
  
  
  Ihre Bereitstellung überprüfen
&lt;/h2&gt;

&lt;p&gt;vLLM und SGLang stellen OpenAI-kompatible Endpunkte bereit. Dadurch können Sie dieselbe Anfrage an Ihren lokalen Server und an &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt; senden:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl http://localhost:8000/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Prüfen Sie mehr als nur die Erreichbarkeit des Endpunkts:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Langzeit-Kontext in der tatsächlich benötigten Länge&lt;/li&gt;
&lt;li&gt;Bildeingaben bei multimodaler Nutzung&lt;/li&gt;
&lt;li&gt;Tool-Calling mit Ihren realen Schemata&lt;/li&gt;
&lt;li&gt;Durchsatz unter parallelen Anfragen&lt;/li&gt;
&lt;li&gt;Einzelanfragen-Latenz&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Eine gespeicherte Testsuite macht den Vergleich reproduzierbar. Richten Sie &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; auf Ihren lokalen Server und den &lt;a href="http://Z.ai" rel="noopener noreferrer"&gt;Z.ai&lt;/a&gt;-Endpunkt ein. Verwenden Sie die Basis-URL als Umgebungsvariable und führen Sie dieselbe Suite gegen beide Ziele aus.&lt;/p&gt;

&lt;p&gt;So sehen Sie schnell, ob Ihr quantisierter Build die Tool-Schemata Ihrer Anwendung noch korrekt verarbeitet – bevor dieser Fehler in der Produktion auftritt.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Was ist die Mindesthardware?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Für volle Präzision benötigen Sie einen 8x-H200-Knoten. Quantisierte GGUF-Builds benötigen deutlich weniger Hardware, allerdings sinkt die Qualität mit zunehmender Quantisierung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Muss ich alle 320 Milliarden Parameter im Speicher haben?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja. Nur 18 Milliarden Parameter sind pro Token aktiv, aber alle Parameter müssen resident sein. Der Speicher ist der Engpass, nicht die Rechenleistung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Was ist besser: vLLM oder SGLang?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
SGLang bot Day-Zero-Unterstützung mit multimodalen Rezepten und ist häufig bei Parallelität und strukturierten Ausgaben schneller. vLLM bietet die breitere Ökosystemunterstützung. Benchmarken Sie beide mit Ihrer Arbeitslast.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Kann ich das Modell auf einer einzelnen GPU ausführen?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Nicht in voller Präzision. Mit aggressiver Quantisierung und CPU-Offload über KTransformers ist ein System mit einer GPU, viel GPU-Speicher und viel System-RAM denkbar. Rechnen Sie mit langsamer Generierung.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Ist die Lizenz wirklich MIT?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ja. Die Gewichte werden unter der MIT-Lizenz veröffentlicht. Kommerzielle Nutzung, Modifikation und Weiterverteilung sind erlaubt.&lt;/p&gt;

</description>
    </item>
  </channel>
</rss>
