主题
高频面试题
什么是自洽性?如何应用?
面试官问自洽性,重点是看你能否把“多次问模型”升级成可评估、可控成本、可聚合答案的推理策略。
面试官角度分析,想考什么
- Self-Consistency 是什么?
考是否能讲出多条推理路径和最终答案投票。 - 为什么投票能提高准确率?
考概率直觉:错误路径分散,正确答案更容易收敛。 - 什么时候适合用?
考答案空间、可比较性和成本意识。 - 怎么避免成本爆炸?
考采样次数、置信度阈值、缓存和降级策略。
可直接抄走的 30 秒参考答案
text
Self-Consistency 是 CoT 的一种增强:对同一个问题用较高 temperature 采样多条推理链,然后抽取最终答案做多数投票。它有效是因为错误推理路径通常比较分散,而正确答案更容易收敛。它适合数学、选择、分类这类答案可比较的任务,不适合开放创作和证据缺失的事实问答。生产里要控制采样次数,只在高价值场景启用。面试回答详解,知其所以然
Self-Consistency 不是“让模型自己检查自己”,而是“让模型从多个可能路径中收敛答案”。
1. 基本流程
典型流程如下:
text
同一问题
-> 多次高温 CoT 采样
-> 抽取每次最终答案
-> 多数投票或 judge 聚合
-> 输出答案和置信度关键点是多次采样必须有差异。如果 temperature=0,每次结果几乎一样,投票没有意义。
2. 为什么它有效
复杂推理题通常有多种推导路径。错误路径可能因为误读条件、算错一步、套错规则而分散到不同答案;正确路径虽然表达不同,但最终答案往往一致。
所以 Self-Consistency 用的是一种集成思想:不相信单次推理,而相信多条独立路径的收敛结果。
3. 如何应用
基础应用适合答案容易比较的任务:
- 数学题:抽取最终数字投票。
- 多选题:抽取选项投票。
- 分类任务:抽取标签投票。
- 规则判断:抽取“通过 / 不通过 / 需人工确认”。
开放文本也可以用,但不能简单字符串投票,需要用 LLM judge、embedding 聚类或规则打分聚合,复杂度和误判风险都会上升。
4. 工程取舍
Self-Consistency 的收益来自更多模型调用,因此主要代价是成本和延迟。采样 5 次就是约 5 倍生成成本,采样 10 次还会拉高 P95 延迟。
常见折中:
- 先采样 3 到 5 次,低置信再追加。
- 只对高风险或低置信任务启用。
- 对中间推理限长,只抽取最终答案。
- 缓存相同问题的聚合结果。
5. 失败模式
Self-Consistency 不能解决所有问题。如果 prompt 本身错了、输入证据缺失、题目有歧义,多个样本可能会稳定地错到同一个答案。
因此它适合降低随机推理错误,不适合替代事实检索、工具校验和业务规则。
面试官追问3个问题
追问一:Self-Consistency 必须配合 CoT 吗?
- 考察点:是否理解多路径推理。
- 回答方向:不绝对,但配合 CoT 最典型,因为投票的是不同推理路径收敛出的答案。
追问二:采样多少次合适?
- 考察点:工程成本意识。
- 回答方向:从 3 到 5 次开始,用评估集看边际收益;高价值任务再增加,避免盲目 20 次以上。
追问三:开放文本怎么投票?
- 考察点:聚合能力。
- 回答方向:可用 judge、rubric、聚类或人工抽检,但成本和 judge 偏差要纳入评估。