目次 / 抽出モデルの選び方

抽出モデルの選び方

① キャラクター抽出には、画像が読める(vision 対応)モデルが必要です。同じ絵を渡しても、モデルによって読み取れる大きさと得意な描写が違います。ふだん用と R18 用で使い分けるのがおすすめです。

結論だけ先に。ふだんは qwen3.8:27b、R18 を含む絵は gemma4:31b-it-qat(GPU が足りなければ 26b → 12b)。画像はそのままの大きさで入れて大丈夫です。
このページは ①(画像を読む)だけの話です。プロンプト生成・シチュエーションの提案・キャラクター生成・パーティ作成・イベント CG は、これまでどおり Gemma 4 の qat シリーズが既定です。そちらは モデルの準備と選び方 にまとめました(Mac は Gemma 4 の mlx 版)。

ふだんは Qwen3.8

ollama pull qwen3.8:27b

画像を大きいまま読めるモデルです。服の柄・小物・髪飾りといった細部を拾うのが得意で、立ち絵からキャラクターの見た目を起こすときの基本になります。抽出 1 回はおよそ 30〜60 秒です。

R18 の絵は Gemma 4

ollama pull gemma4:31b-it-qat

行為そのものの描写は Gemma 4 のほうが素直に出ます。R18 を含む絵ではこちらを使ってください。お使いの GPU に合わせて、次の順で選びます(上ほど結果がよく、下ほど軽い)。

モデルダウンロード容量目安
gemma4:31b-it-qat約 19 GBいちばん結果がよい。VRAM 24GB 以上が快適
gemma4:26b-a4b-it-qat約 16 GBVRAM 16GB でも動かしやすい
gemma4:12b-it-qat約 7 GBいちばん軽い。抽出 1 回 20〜30 秒

ただし Gemma 4 は、送った画像を 803×803 相当まで縮めてから読みます(モデル側の仕様)。大きい画像を入れても細部は活きないので、細かいところを見せたいときはトリミングで対象を大きくしてください。

どのくらい違うのか

同じイラスト(4088×5931)を渡したときに、モデルが実際に見ている大きさです。

モデル実際に読む大きさ読める上限抽出 1 回の目安*得意なこと
Qwen3.8
qwen3.8:27b
1696 × 24642048 × 2048 相当30〜60 秒服の柄・小物・髪飾りなどの細部
Gemma 4
gemma4:31b-it-qat など
624 × 960803 × 803 相当20〜35 秒R18 の描写

* RTX 5070 Ti(VRAM 16GB)での実測です。環境によって変わります。

画像はどのくらいの大きさで入れればいい?

そのままの大きさで入れて大丈夫です。Pixubus は縮小せずにモデルへ渡します。上限を超えた分はモデル側が自動で縮めるので、失敗にはなりません。

Qwen3.8 が縮小せずに丸ごと読める大きさの目安です。

画像の形丸ごと読める最大サイズ
正方形2048 × 2048
縦長(3:4)1760 × 2336
縦長(2:3)1664 × 2496
横長(16:9)2720 × 1536

ざっくり言うと 長辺 2000〜2700px までです。これより大きい画像は縮小されるので、細かいところまで拾いたいときはトリミングで対象を大きくするほうが効果があります。

コンテキスト(⚙ の数値)について

既定のままで問題ありません。画像がコンテキストを使う量にはモデル側の上限があるため、どんなに大きい画像でも既定の 16,384 に必ず収まります。

⚙ を手で 8,192 以下に下げているときだけ、大きい画像で結果が途中で切れることがあります。そのときはアプリが実行前に知らせます。

数値の前提。ここに書いた読み取り上限は Ollama 0.33.2 時点で実測したものです。Ollama やモデルの更新で変わることがあります。