よく検索されているプロンプト(R18)
カテゴリ:deeplearning
T2I 拡散モデルの設計メモ
カテゴリ:deeplearning
目次
- クラウド GPU
- テキストエンコーダー
- VAE
- GAN
- コンディショニング
- 位置埋め込み
- 目的関数
- Transformer アーキテクチャ
- Transformer を使わないアーキテクチャ
- Gated MLP
- ブロック図
- データセット
- キャプショニング
- 学習方法
- 高速化
- ワーキングメモリー
- 教師ありファインチューニング
- 強化学習
Pytorch モデルを fp16 で動作させる方法
カテゴリ:deeplearning
pytorch のモデルは half() を呼び出せば fp16 になる。しかし、LayerNormalization などのレイヤーは非常に小さな値を扱うので、fp32 で動作させた方が良い。
VRAM 8 GB で Qwen Image(Edit)を ComfyUI で実行する
カテゴリ:deeplearning
目次
Python 3.11.6 で reforge を使う
カテゴリ:deeplearning
ROCm の whl のサポートが 3.11 からなので、3.11 で動作することは重要だ。
SDXL Q8_0 量子化が流行らない理由
カテゴリ:deeplearning
VRAM を 800 MB 節約できるだけで、生成速度は fp16 と変わらないから。
Windows で Radeon を使って ComfyUI や Automatic1111WebUI を動かす
カテゴリ:deeplearning
Waifu Diffusion で効率的に画像を生成する
カテゴリ:deeplearning
プロンプトリストはプロンプトやよく検索されているプロンプト(R18)、danbooru タグ検索を参照。
目次
- ワークフロー
- ツールの選択
- Stable Diffusion のモデルリンク
- Stable Diffusion の解説
- Tips
- 上手く描けない場合(胴が長いなど)はアスペクト比を変えてみる
- クオリティタグを使う
- CFG Scale を上げる
- 解像度を上げると頭や体が複数融合する
- Denoising Strength を下げると画質が落ちる
- 細部の修正
- 手の修正
- 手の自由度
- 高解像度化
- 色のコントロール
- 顔に影ができる
- ファインチューニング
Tsukasa-Speech を Windows で GPU で動かす
カテゴリ:deeplearning
デフォルトの状態ではメモリが解放されず、動作を続けると VRAM が不足するのでアプリの再起動が必要になる。
512 トークン制限があり、一度に生成できる文字数は日本語の場合 200 文字に届かない程度。
ファイルアップロードバグ
gr.Audio にはバグがあり、"Too little data for declared Content-Length" のエラーメッセージで、リファレンス音声の再アップロードに失敗する。詳細は Audio component: gradio RuntimeError: Response content shorter than Content-Length #8878 を参照。大きいファイルではエラーが起こらず、小さいファイルを再アップロードすると発生することから、キャッシュが悪さをしている可能性がある。
対処法としては
- アプリを再起動
- ファイルをリネームしてアップロード
Windows で llama.cpp のビルド
カテゴリ:deeplearning