research 読了 15 分 更新 2026-08-11 仕様公開・V10回顧適用
『良いAI画像プロンプト』を数値化できるか|Prompt Quality Scoreを設計しV10へ試験適用
主観語を避け、複数Seedを共通指標で比べるPrompt Quality Score(PQS)を設計。加重平均・幾何平均・失敗ペナルティ案を比較し、同一SeedアブレーションV10の採点へ回顧適用した。
この記事で分かること
- 「良かった」「綺麗」を、比較可能な指標へ落とす方法
- PQSの評価軸・Rubric・合成案(掛け算だけにしない)
- 既存 V10(40枚)への 回顧適用 の数値
- 使いづらいなら総合点を捨て、Dashboard形式でもよいという判断基準
問題意識
AI画像記事は主観表現が多い。RealBiosでは複数Seedを前提に、共通指標で改善比較できるようにする。Score自体が目的ではない。目的は Prompt改善を比較可能にすること。
評価軸(0〜5)
| 軸 | 意味 |
|---|---|
| Prompt Adherence | 指示への従い方 |
| Character Consistency | 人物属性の一貫性 |
| Composition Accuracy | 指定構図への一致 |
| Anatomy | 人体破綻の少なさ |
| Artifact Control | 不要物・異常の少なさ(高いほど良い) |
| Visual Quality | 最終的な視覚品質(overall相当) |
| Seed Stability | ばらつきの小ささ(条件集計) |
| Adoption Rate | 採用可能割合 |
Rubric(Human-in-the-loop)
| 点 | 基準 |
|---|---|
| 5 | 明確に満たす |
| 4 | ほぼ満たす |
| 3 | 一部問題 |
| 2 | 目立つ問題 |
| 1 | 重大問題 |
| 0 | 失敗(対象軸が成立しない) |
合成指標の候補比較
単純平均だけでは、平均8点でも10枚中3枚で人物が2人、のような致命失敗を見逃す。
| 案 | 式の考え方 | 長所 | 短所 |
|---|---|---|---|
| A 加重平均 | 0.25*Adherence + 0.2*Character + 0.15*Composition + 0.15*Anatomy + 0.15*Artifact + 0.1*Visual | 直感的 | 分散を無視 |
| B 平均×安定×採用 | mean(overall) × (1−std/2) × (0.5+0.5*adopt) | ハズレと採用を同時に罰する | 掛け算で過敏 |
| C 最低点ペナルティ | 0.7*mean + 0.3*min | Worstを残す | 採用率を直接見ない |
| D Dashboard | 総合点を出さず mean / min / adopt / target軸 を並列 | 実務で使いやすい | SEO的な「1つの点数」が弱い |
V10への試験適用(回顧)
データ源: prompt-ablation-same-seed の40枚採点(新規画像なし)。
| 条件 | mean(overall) | min | std | 採用率 | PQS_prod |
|---|---|---|---|---|---|
| A Full | 3.00 | 3 | 0.00 | 0% | 1.50 |
| B No Structure | 3.20 | 3 | 0.40 | 20% | 1.54 |
| C No Support | 3.00 | 2 | 0.63 | 20% | 1.23 |
| D No Narrative | 3.00 | 3 | 0.00 | 0% | 1.50 |
| E No Lighting | 3.00 | 3 | 0.00 | 0% | 1.50 |
| F Minimal Neg | 3.20 | 3 | 0.40 | 20% | 1.54 |
| G Reduced Quality | 3.00 | 3 | 0.00 | 0% | 1.50 |
| H Simplified DNA | 2.00 | 2 | 0.00 | 0% | 1.00 |
- 総合点が近い条件でも、stdと採用率で差が出る(Cはminが低くPQS_prodが下がる)
- Hはmeanが明確に低く、キャラDNA簡略化の悪化と整合
- Aは光などが高くても両手動作未達で採用0% → 単軸の美しさ≠採用
- 以前の「暫定支持/保留」記述と矛盾させず、PQSは補助指標として使う
MakingカードUI(将来)
例:
- Seeds tested: 10
- Adoption rate: 70%
- Prompt adherence: 8.2(10点換算時)
- PQS: 7.6
実践ルール
1. 採点基準を生成前に固定する
2. 失敗画像を分母から外さない
3. 総合点だけで勝敗を決めない
4. 致命フラグ(人数増・手消失等)は平均値に隠さない
5. 5 Seedでは有意差を主張しない
限界
- V10はポーズ忠実度が全体に低く、PQS_prodが押し下げられる
- 回顧適用は当時のRubricに依存
- VLM自動採点は未実施
次
- V11/V12/V13の生成後に同一PQSで縦比較
- Knowledge prompt-quality-score を評価時の正本にする