目次 / 抽出モデルの選び方
抽出モデルの選び方
① キャラクター抽出には、画像が読める(vision 対応)モデルが必要です。同じ絵を渡しても、モデルによって読み取れる大きさと得意な描写が違います。ふだん用と R18 用で使い分けるのがおすすめです。
qwen3.8:27b、R18 を含む絵は gemma4:31b-it-qat(GPU が足りなければ 26b → 12b)。画像はそのままの大きさで入れて大丈夫です。ふだんは Qwen3.8
ollama pull qwen3.8:27b
画像を大きいまま読めるモデルです。服の柄・小物・髪飾りといった細部を拾うのが得意で、立ち絵からキャラクターの見た目を起こすときの基本になります。抽出 1 回はおよそ 30〜60 秒です。
R18 の絵は Gemma 4
ollama pull gemma4:31b-it-qat
行為そのものの描写は Gemma 4 のほうが素直に出ます。R18 を含む絵ではこちらを使ってください。お使いの GPU に合わせて、次の順で選びます(上ほど結果がよく、下ほど軽い)。
| モデル | ダウンロード容量 | 目安 |
|---|---|---|
gemma4:31b-it-qat | 約 19 GB | いちばん結果がよい。VRAM 24GB 以上が快適 |
gemma4:26b-a4b-it-qat | 約 16 GB | VRAM 16GB でも動かしやすい |
gemma4:12b-it-qat | 約 7 GB | いちばん軽い。抽出 1 回 20〜30 秒 |
ただし Gemma 4 は、送った画像を 803×803 相当まで縮めてから読みます(モデル側の仕様)。大きい画像を入れても細部は活きないので、細かいところを見せたいときはトリミングで対象を大きくしてください。
どのくらい違うのか
同じイラスト(4088×5931)を渡したときに、モデルが実際に見ている大きさです。
| モデル | 実際に読む大きさ | 読める上限 | 抽出 1 回の目安* | 得意なこと |
|---|---|---|---|---|
Qwen3.8qwen3.8:27b | 1696 × 2464 | 2048 × 2048 相当 | 30〜60 秒 | 服の柄・小物・髪飾りなどの細部 |
Gemma 4gemma4:31b-it-qat など | 624 × 960 | 803 × 803 相当 | 20〜35 秒 | R18 の描写 |
* RTX 5070 Ti(VRAM 16GB)での実測です。環境によって変わります。
画像はどのくらいの大きさで入れればいい?
そのままの大きさで入れて大丈夫です。Pixubus は縮小せずにモデルへ渡します。上限を超えた分はモデル側が自動で縮めるので、失敗にはなりません。
Qwen3.8 が縮小せずに丸ごと読める大きさの目安です。
| 画像の形 | 丸ごと読める最大サイズ |
|---|---|
| 正方形 | 2048 × 2048 |
| 縦長(3:4) | 1760 × 2336 |
| 縦長(2:3) | 1664 × 2496 |
| 横長(16:9) | 2720 × 1536 |
ざっくり言うと 長辺 2000〜2700px までです。これより大きい画像は縮小されるので、細かいところまで拾いたいときはトリミングで対象を大きくするほうが効果があります。
コンテキスト(⚙ の数値)について
既定のままで問題ありません。画像がコンテキストを使う量にはモデル側の上限があるため、どんなに大きい画像でも既定の 16,384 に必ず収まります。
⚙ を手で 8,192 以下に下げているときだけ、大きい画像で結果が途中で切れることがあります。そのときはアプリが実行前に知らせます。