学术相关
From script to stage: automating experimental design for social simulations with LLMs 1
控制太弱了,我不看好这个思路
LLM 实验设计的主要局限性在可靠性和科学严谨性, 这篇paper提出了FSTS框架。
ABM - Decision-Theater (Wolf et al., 2023) - FSTS?
- Script Composition
- generates multiple candidate experimental schemas
- Script Finalization
- evaluates candidates (LLM as Judge)
- Actor Generation
- instantiates experimental agents

Beyond the black box: unraveling the role of explainability in human-artificial intelligence collaboration 2
一篇研究可解释性如何影响决策准确性、缺乏依赖和过度依赖,以及决策者的认知努力的理论建模研究,但是我对其中一些与”经验相符“的声明存在质疑,这些”经验“没有经过实证的检验,不足以支撑这个理论模型的合法性。
- 降低算法厌恶&过度依赖问题:增强算法透明性
- 使用易理解模型(如回归模型,决策树等)
- 提供解释(局部特征解释,反事实解释等)
- 提供信心度量或不确定得分
建模
DM’s optimization problem: $\max_{f} A_h(f) - C_h(f) \quad \text{s.t.} \quad \int_\sigma f(1,\sigma) , d\sigma = \mu,$
- $A_h^\ast$ accuracy level
- $C_h^\ast$ cognitive cost
$\alpha_h^* = \mathbb{P}{\omega = 0 \mid a = y} p_y^* \quad \text{and} \quad \beta_h^* = \mathbb{P}{\omega = 1 \mid a = n}(1 - p_y^*),$
- $\alpha_h^*$ : false positive error rate
- $\beta_h^*$ : false negative error rate
- $\omega$ : state of the world
- $a$ : action / choice(决策者的行动,取值是或否)
- $p_y^*$ : ex ante probability of choosing $a = y$ at optimality(最优时选择 $y$ 的先验概率)
- $\mathbb{P}{\omega \mid a}$ : posterior belief(后验信念,给定行动 $a$ 时状态为 $\omega$ 的概率)
给定先验概率$\mu$和信息成本$\lambda>0$
$A_h^\star(\mu) = \begin{cases} 1 - \mu & \text{if } \mu \leq \underline{\mu} \\ \frac{e^{1/\lambda}}{e^{1/\lambda} + 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ \mu & \text{if } \mu \geq \overline{\mu}, \end{cases}$
$C_h^\star(\mu) = \begin{cases}\lambda[H(\mu) - \varphi(\lambda)] & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 0 & \text{otherwise},\end{cases}$
$\alpha_h^\star(\mu) = \begin{cases}0 & \text{if } \mu \leq \underline{\mu} \\ \frac{\mu(e^{1/\lambda} + 1) - 1}{e^{2/\lambda} - 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 1 - \mu & \text{if } \mu \geq \overline{\mu},\end{cases}$
$\beta_h^\star(\mu) = \begin{cases}\mu & \text{if } \mu \leq \underline{\mu} \\ \frac{e^{1/\lambda} - \mu(e^{1/\lambda} + 1)}{e^{2/\lambda} - 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 0 & \text{if } \mu \geq \overline{\mu},\end{cases}$
- μ : lower belief threshold
- μ : upper belief threshold
$\varphi(\lambda) = \log(e^{1/\lambda} + 1) - \frac{1}{\lambda} \frac{e^{1/\lambda}}{e^{1/\lambda} + 1}.$
-
阈值决定:信息成本 λ 完全决定了信念阈值 $(\underline{\mu}, \overline{\mu})$。
- λ 越大 → 区间 $(\underline{\mu}, \overline{\mu})$ 越窄 → DM 面临的认知约束越强。
-
强先验情形($\mu \leq \underline{\mu}$ 或 $\mu \geq \overline{\mu}$):
- DM 对真实状态有足够强的先验信念。
- 付出认知努力获取额外信息的收益不足以覆盖成本。
- DM 选择偷懒,仅依据先验信念 $\mu$ 直接决策:
-
高不确定性情形($\mu \in (\underline{\mu}, \overline{\mu})$):
-
任务具有充分的不确定性。
-
DM 总是付出努力以获取额外信息,再做出决策。
-
DM 持续处理信息,只要其基于所诱导信号的后验信念仍落在搜索区间 $(\underline{\mu}, \overline{\mu})$ 内。
-
停止规则:当信念触及下阈值 $\underline{\mu}$ 或上阈值 $\overline{\mu}$ 时,决策过程停止。
- 这两个阈值仅由信息成本 $\lambda$ 决定。
-
机器预测与解释
ML 算法给出一个关于the true state of the world的信号和理由;ML有高低两种质量
可解释水平$\xi \equiv \mathbb{P}{E = h \mid X = h} = \mathbb{P}{E = \ell \mid X = \ell} \in [1/2, 1]$ 即两种质量ML说真话的概率在[1/2, 1]之间(完全黑盒->完全透明)
收到ML的解释$E$后,DM更新先验信念$\theta \to \theta^e$
后验信念$ \theta^{se} \equiv \mathbb{P}{X = h \mid S = s, E = e}$ 表示 DM 在观察到机器预测 $s$ 和解释 $e$ 后,更新后的信念(ML属于高质量类型的概率)
人机交互
信念更新:
$\mu^{+e} = 1 \cdot \theta^{+e} + \mu \cdot (1-\theta^{+e}) = \mu(1-\theta^{+e}) + \theta^{+e}$
$\mu^{-e} = 0 \cdot \theta^{-e} + \mu \cdot (1-\theta^{-e}) = \mu(1-\theta^{-e})$
- overreliance: 当ML是错误的,人类选择相信ML的判断
- underreliance: 当ML是正确的,人类选择反对ML的判断
核心结论
- AI低可解释性水平对决策准确性和AI依赖行为没有影响,但减轻了决策的认知负担
- 高可解释性通过改善AI过渡依赖来提升正确性,但代价是增加AI依赖不足程度(算法厌恶)和认知消耗
- 决策者更容易”过度依赖”而非”依赖不足”,即算法厌恶在人机协作中不如自动化偏见突出
- 决策者认知约束越强(时间压力、多任务、任务复杂),可解释性的作用越大
- 决策风险越低,可解释性越有效;风险高时决策者自然投入更多认知努力,解释的边际收益被削弱
- 只有当认知约束足够高(λ > λ̄)时,可解释性才真正改善准确性;约束较低时完全无效
- 认知成本随可解释性呈非单调变化
- 当决策者认知约束显著、任务最不确定、且对机器质量存疑时,某些可解释性水平反而会比”无解释”基准消耗更多认知努力——即使解释近乎完美(ξ→1)
- 若理解解释本身耗费认知(如长篇文字解释),决策者可能干脆忽略解释、把机器当黑箱,此时过度依赖最严重、准确性最低
-
Guo, Y., Zhao, Z., Liu, X., Yu, X., Ma, Q., Zhou, D., & Xue, X. (2026). From script to stage: Automating experimental design for social simulations with LLMs. Findings of the Association for Computational Linguistics: ACL 2026, 15897–15916. https://doi.org/10.18653/v1/2026.findings-acl.780 ↩
-
Boyacı, T., Canyakmaz, C., & De Véricourt, F. (2026). Beyond the black box: Unraveling the role of explainability in human-artificial intelligence collaboration. Management Science, mnsc.2024.7450. https://doi.org/10.1287/mnsc.2024.07450 ↩