六维评分:我们怎么让 AI 创意"可量化"¶
第 3 篇。聊聊 Creativor 的六维评分体系——为什么是这六个维度,分数怎么打,怎么用。
一、创意能不能打分¶
广告圈有句老话:"创意是主观的,你觉得好我觉得烂。" 这句话对一半。创意的"好坏"确实有主观成分,但创意的"质量"是有客观维度的——原创不原创、能不能落地、受众能不能看懂,这些都是可以量化判断的。
问题是,传统创意评审靠"创意总监拍脑袋",质量取决于总监的水平,且不可复现。Creativor 想做的事情是:把创意评审的标准显性化、结构化,让 AI 也能按这套标准打分。
于是有了六维评分体系。
二、六个维度是什么¶
| 维度 | 评估什么 | 高分样态 | 低分样态 |
|---|---|---|---|
| originality 原创性 | 是否避开陈词滥调 | "茶汤有絮,才是真茶" | "一杯奶茶,一段时光" |
| emotionalResonance 情感共鸣 | 能否打动目标受众 | 让人想起外婆的厨房 | 无感,像产品说明书 |
| aestheticAppeal 美学价值 | 视觉与文案的审美水准 | 留白克制,质感高级 | 元素堆砌,配色俗气 |
| executionFeasibility 执行可行性 | 能否在预算内落地 | 普通摄影棚即可拍 | 需要好莱坞特效团队 |
| unexpectedAssociations 意外关联 | 跨领域碰撞的惊喜度 | 把菌丝网络和茶树根系连起来 | "茶=自然"这种常识关联 |
| interpretability 可解读性 | 受众能否理解创意意图 | 一眼就懂,越想越有味 | 看三遍不知道在卖什么 |
三、为什么是这六个¶
我们一开始试过四维(原创、共鸣、美学、可行性),发现漏了两个关键东西:
- 没有"意外关联",跨领域碰撞的价值没法被奖励,AI 会倾向于输出安全但平庸的关联。
- 没有"可解读性",AI 为了追求原创和意外,会输出大量"自嗨型"创意——作者觉得牛逼,受众一脸懵。
加上这两个维度后,六维之间形成了制衡:
- 原创性 ↔ 可解读性:防止太烂俗,也防止太晦涩。
- 意外关联 ↔ 执行可行性:防止太无趣,也防止太空中楼阁。
- 情感共鸣 ↔ 美学价值:防止太功利,也防止太形式主义。
六个维度的张力,逼着 AI 在"安全"和"冒险"之间找到那个甜点。
四、分数怎么打¶
创意总监 Agent 输出 JSON 格式的评分,每项 1-10 分。Prompt 里明确要求:
- 7 分以上必须有具体理由(引用创意里的某句话)。
- 5 分以下必须指出具体问题(哪个词俗、哪个画面执行不了)。
- 不允许全部 8 分以上——总评必须有高低差,否则视为敷衍,自动返工。
打分后,系统计算六维的最低分。任何一项低于 6 分,整个方向标记为"需返工",自动回到对应 Agent 重新生成。 比如可解读性低,就回到文案 Agent 让它重写更直白;执行可行性低,就回到美术指导让它换可落地的画面。
五、为什么"可解读性"最难拿高分¶
实测中我们发现,六个维度里,AI 最容易在"可解读性"上翻车。原因很有意思:AI 的"理解"和人的"理解"不是一回事。
AI 觉得"菌丝网络隐喻品牌社群生态"很清楚,因为它知道菌丝网络是什么。但普通受众看到"像菌丝一样生长"这句话,第一反应是"恶心,蘑菇根部那种?"
跨领域碰撞越成功,可解读性风险越高——因为你用的隐喻越生僻,受众越跟不上。所以我们的策略师 Agent 在选概念时,会优先选"有通俗对应物"的跨领域概念(比如"深海生态"比"量子纠缠"更易解读),这是概念库建设时就要考虑的。
六、评分数据飞轮¶
每个项目的评分都会沉淀。我们的长期目标是:用这些评分数据训练一个"创意质量预测器",在策略师输出方向时就预测六维分数,提前过滤掉大概率不及格的方向,节省后续 Agent 的算力。
更进一步,评分数据可以反哺概念库——哪些跨领域概念经常产出高分创意,权重就提高;哪些经常翻车,权重降低。用户用得越多,概念库越懂什么碰撞有效,这就是 Creativor 的数据飞轮。
七、结语¶
我们不是要把创意变成流水线,而是给创意一个"质量底线"。六维评分保证每个放行的创意至少是"合格的",至于"惊艳"还是"优秀",依然需要人的判断和打磨。
AI 负责下限,人负责上限。这是 Creativor 的分工哲学。
Creativor —— 让创意质量可量化、可返工、可复现。