research 読了 15 分 更新 2026-08-11 仕様公開・V10回顧適用

『良いAI画像プロンプト』を数値化できるか|Prompt Quality Scoreを設計しV10へ試験適用

主観語を避け、複数Seedを共通指標で比べるPrompt Quality Score(PQS)を設計。加重平均・幾何平均・失敗ペナルティ案を比較し、同一SeedアブレーションV10の採点へ回顧適用した。

この記事で分かること

  • 「良かった」「綺麗」を、比較可能な指標へ落とす方法
  • PQSの評価軸・Rubric・合成案(掛け算だけにしない)
  • 既存 V10(40枚)への 回顧適用 の数値
  • 使いづらいなら総合点を捨て、Dashboard形式でもよいという判断基準

問題意識

AI画像記事は主観表現が多い。RealBiosでは複数Seedを前提に、共通指標で改善比較できるようにする。Score自体が目的ではない。目的は Prompt改善を比較可能にすること

評価軸(0〜5)

意味
Prompt Adherence 指示への従い方
Character Consistency 人物属性の一貫性
Composition Accuracy 指定構図への一致
Anatomy 人体破綻の少なさ
Artifact Control 不要物・異常の少なさ(高いほど良い)
Visual Quality 最終的な視覚品質(overall相当)
Seed Stability ばらつきの小ささ(条件集計)
Adoption Rate 採用可能割合

Rubric(Human-in-the-loop)

基準
5 明確に満たす
4 ほぼ満たす
3 一部問題
2 目立つ問題
1 重大問題
0 失敗(対象軸が成立しない)

合成指標の候補比較

単純平均だけでは、平均8点でも10枚中3枚で人物が2人、のような致命失敗を見逃す。

式の考え方 長所 短所
A 加重平均 0.25*Adherence + 0.2*Character + 0.15*Composition + 0.15*Anatomy + 0.15*Artifact + 0.1*Visual 直感的 分散を無視
B 平均×安定×採用 mean(overall) × (1−std/2) × (0.5+0.5*adopt) ハズレと採用を同時に罰する 掛け算で過敏
C 最低点ペナルティ 0.7*mean + 0.3*min Worstを残す 採用率を直接見ない
D Dashboard 総合点を出さず mean / min / adopt / target軸 を並列 実務で使いやすい SEO的な「1つの点数」が弱い

V10への試験適用(回顧)

データ源: prompt-ablation-same-seed の40枚採点(新規画像なし)。

条件 mean(overall) min std 採用率 PQS_prod
A Full 3.00 3 0.00 0% 1.50
B No Structure 3.20 3 0.40 20% 1.54
C No Support 3.00 2 0.63 20% 1.23
D No Narrative 3.00 3 0.00 0% 1.50
E No Lighting 3.00 3 0.00 0% 1.50
F Minimal Neg 3.20 3 0.40 20% 1.54
G Reduced Quality 3.00 3 0.00 0% 1.50
H Simplified DNA 2.00 2 0.00 0% 1.00
  • 総合点が近い条件でも、stdと採用率で差が出る(Cはminが低くPQS_prodが下がる)
  • Hはmeanが明確に低く、キャラDNA簡略化の悪化と整合
  • Aは光などが高くても両手動作未達で採用0% → 単軸の美しさ≠採用
  • 以前の「暫定支持/保留」記述と矛盾させず、PQSは補助指標として使う

MakingカードUI(将来)

例:

  • Seeds tested: 10
  • Adoption rate: 70%
  • Prompt adherence: 8.2(10点換算時)
  • PQS: 7.6

実践ルール

1. 採点基準を生成前に固定する

2. 失敗画像を分母から外さない

3. 総合点だけで勝敗を決めない

4. 致命フラグ(人数増・手消失等)は平均値に隠さない

5. 5 Seedでは有意差を主張しない

限界

  • V10はポーズ忠実度が全体に低く、PQS_prodが押し下げられる
  • 回顧適用は当時のRubricに依存
  • VLM自動採点は未実施

  • V11/V12/V13の生成後に同一PQSで縦比較
  • Knowledge prompt-quality-score を評価時の正本にする

関連

同じところで止まるときの続き

ここまでが、1テーマ分の判断ログです。有料ノートや実践テンプレでは、同じ切り方をシート・チェックリスト・失敗ログとして一通り揃えられます。

まずこの記事の手順だけ試し、毎回同じ詰まり方をすると感じたときに続きを見てください。

公開前チェックリスト(無料) 実験ログのテンプレートを見る プロンプト改善キットを見る