よく検索されているプロンプト(R18)
Wan2.2 の timestep 境界 0.875 の計算
0.875 にはならないが以下の方法で計算していると考えられる。
Tsukasa-Speech を Windows で GPU で動かす
デフォルトの状態ではメモリが解放されず、動作を続けると VRAM が不足するのでアプリの再起動が必要になる。
512 トークン制限があり、一度に生成できる文字数は日本語の場合 200 文字に届かない程度。
ファイルアップロードバグ
gr.Audio にはバグがあり、"Too little data for declared Content-Length" のエラーメッセージで、リファレンス音声の再アップロードに失敗する。詳細は Audio component: gradio RuntimeError: Response content shorter than Content-Length #8878 を参照。大きいファイルではエラーが起こらず、小さいファイルを再アップロードすると発生することから、キャッシュが悪さをしている可能性がある。
対処法としては
- アプリを再起動
- ファイルをリネームしてアップロード
NAG Normalized Attention Guide の原理
ComfyUI の CFGNorm・Adaptive Projected Guidanceノードとは何か
LLM を使ったストーリー作成
LLM を使ったストーリー作成が一発でうまくいく事はない。なので、ストーリー作成の各工程ごとにアイデア出しの補助をさせることでストーリーを作成する。
AI のべりすとは日本語が使えるが性能は高くない。無料で公開されているローカル実行できる LLM を英語で使ったり、Chat GPT を使う方が効率がいい。AI のべりすとの強みはアダルト文章を日本語で出力できることだ。
モデルについてはおすすめの日本語対応ローカル大規模言語モデルを参照。
目次
Python 3.11.6 で reforge を使う
ROCm の whl のサポートが 3.11 からなので、3.11 で動作することは重要だ。
forge-classic は python 3.11、torch 2.8.0、cuda 12.8 なのでこちらを使った方が早い。
Wan 2.1 の論文メモ
Windows で llama.cpp のビルド
oobabooga の tips
AIのべりすとのようにプロンプトを編集しながらテキストを生成する
Default タブでできる。
テキスト生成のショートカットは Shift + Enter。
CPU のスレッド数を制限する
CPU で処理する場合4スレッドあたりで性能の限界が来る。E コアや Hyperthreading がスレッドをつかむと遅くなるので、Model タブで実行スレッドを制限する。