【阅】本周阅读摘选2026-08-24 → 2026-08-30

Posted by Cao Zihang on August 31, 2026 Word Count:
本周阅读摘选
2026-08-24 → 2026-08-30
目录

学术相关

From script to stage: automating experimental design for social simulations with LLMs 1

控制太弱了,我不看好这个思路

LLM 实验设计的主要局限性在可靠性和科学严谨性, 这篇paper提出了FSTS框架。

ABM - Decision-Theater (Wolf et al., 2023) - FSTS?

  • Script Composition
    • generates multiple candidate experimental schemas
  • Script Finalization
    • evaluates candidates (LLM as Judge)
  • Actor Generation
    • instantiates experimental agents

2026-08-31-week-20260902205804

Beyond the black box: unraveling the role of explainability in human-artificial intelligence collaboration 2

一篇研究可解释性如何影响决策准确性、缺乏依赖和过度依赖,以及决策者的认知努力的理论建模研究,但是我对其中一些与”经验相符“的声明存在质疑,这些”经验“没有经过实证的检验,不足以支撑这个理论模型的合法性。

  • 降低算法厌恶&过度依赖问题:增强算法透明性
    • 使用易理解模型(如回归模型,决策树等)
    • 提供解释(局部特征解释,反事实解释等)
    • 提供信心度量或不确定得分

建模

DM’s optimization problem: $\max_{f} A_h(f) - C_h(f) \quad \text{s.t.} \quad \int_\sigma f(1,\sigma) , d\sigma = \mu,$

  • $A_h^\ast$ accuracy level
  • $C_h^\ast$ cognitive cost

$\alpha_h^* = \mathbb{P}{\omega = 0 \mid a = y} p_y^* \quad \text{and} \quad \beta_h^* = \mathbb{P}{\omega = 1 \mid a = n}(1 - p_y^*),$

  • $\alpha_h^*$ : false positive error rate
  • $\beta_h^*$ : false negative error rate
  • $\omega$ : state of the world
  • $a$ : action / choice(决策者的行动,取值是或否)
  • $p_y^*$ : ex ante probability of choosing $a = y$ at optimality(最优时选择 $y$ 的先验概率)
  • $\mathbb{P}{\omega \mid a}$ : posterior belief(后验信念,给定行动 $a$ 时状态为 $\omega$ 的概率)

给定先验概率$\mu$和信息成本$\lambda>0$

$A_h^\star(\mu) = \begin{cases} 1 - \mu & \text{if } \mu \leq \underline{\mu} \\ \frac{e^{1/\lambda}}{e^{1/\lambda} + 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ \mu & \text{if } \mu \geq \overline{\mu}, \end{cases}$

$C_h^\star(\mu) = \begin{cases}\lambda[H(\mu) - \varphi(\lambda)] & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 0 & \text{otherwise},\end{cases}$

$\alpha_h^\star(\mu) = \begin{cases}0 & \text{if } \mu \leq \underline{\mu} \\ \frac{\mu(e^{1/\lambda} + 1) - 1}{e^{2/\lambda} - 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 1 - \mu & \text{if } \mu \geq \overline{\mu},\end{cases}$

$\beta_h^\star(\mu) = \begin{cases}\mu & \text{if } \mu \leq \underline{\mu} \\ \frac{e^{1/\lambda} - \mu(e^{1/\lambda} + 1)}{e^{2/\lambda} - 1} & \text{if } \underline{\mu} < \mu < \overline{\mu} \\ 0 & \text{if } \mu \geq \overline{\mu},\end{cases}$

  • μ​ : lower belief threshold
  • μ​ : upper belief threshold

$\varphi(\lambda) = \log(e^{1/\lambda} + 1) - \frac{1}{\lambda} \frac{e^{1/\lambda}}{e^{1/\lambda} + 1}.$

  • 阈值决定:信息成本 λ 完全决定了信念阈值 $(\underline{\mu}, \overline{\mu})$。

    • λ 越大 → 区间 $(\underline{\mu}, \overline{\mu})$ 越窄 → DM 面临的认知约束越强
  • 强先验情形($\mu \leq \underline{\mu}$ 或 $\mu \geq \overline{\mu}$):

    • DM 对真实状态有足够强的先验信念。
    • 付出认知努力获取额外信息的收益不足以覆盖成本
    • DM 选择偷懒,仅依据先验信念 $\mu$ 直接决策:
  • 高不确定性情形($\mu \in (\underline{\mu}, \overline{\mu})$):

    • 任务具有充分的不确定性。

    • DM 总是付出努力以获取额外信息,再做出决策。

    • DM 持续处理信息,只要其基于所诱导信号的后验信念仍落在搜索区间 $(\underline{\mu}, \overline{\mu})$ 内。

    • 停止规则:当信念触及下阈值 $\underline{\mu}$ 或上阈值 $\overline{\mu}$ 时,决策过程停止。

      • 这两个阈值仅由信息成本 $\lambda$ 决定

机器预测与解释

ML 算法给出一个关于the true state of the world的信号和理由;ML有高低两种质量

可解释水平$\xi \equiv \mathbb{P}{E = h \mid X = h} = \mathbb{P}{E = \ell \mid X = \ell} \in [1/2, 1]$ 即两种质量ML说真话的概率在[1/2, 1]之间(完全黑盒->完全透明)

收到ML的解释$E$后,DM更新先验信念$\theta \to \theta^e$

后验信念$ \theta^{se} \equiv \mathbb{P}{X = h \mid S = s, E = e}$ 表示 DM 在观察到机器预测 $s$ 和解释 $e$ 后,更新后的信念(ML属于高质量类型的概率)

人机交互

信念更新:

$\mu^{+e} = 1 \cdot \theta^{+e} + \mu \cdot (1-\theta^{+e}) = \mu(1-\theta^{+e}) + \theta^{+e}$

$\mu^{-e} = 0 \cdot \theta^{-e} + \mu \cdot (1-\theta^{-e}) = \mu(1-\theta^{-e})$

  • overreliance: 当ML是错误的,人类选择相信ML的判断
  • underreliance: 当ML是正确的,人类选择反对ML的判断

核心结论

  • AI低可解释性水平对决策准确性和AI依赖行为没有影响,但减轻了决策的认知负担
  • 高可解释性通过改善AI过渡依赖来提升正确性,但代价是增加AI依赖不足程度(算法厌恶)和认知消耗
  • 决策者更容易”过度依赖”而非”依赖不足”,即算法厌恶在人机协作中不如自动化偏见突出
  • 决策者认知约束越强(时间压力、多任务、任务复杂),可解释性的作用越大
  • 决策风险越低,可解释性越有效;风险高时决策者自然投入更多认知努力,解释的边际收益被削弱
  • 只有当认知约束足够高(λ > λ̄)时,可解释性才真正改善准确性;约束较低时完全无效
  • 认知成本随可解释性呈非单调变化
  • 当决策者认知约束显著、任务最不确定、且对机器质量存疑时,某些可解释性水平反而会比”无解释”基准消耗更多认知努力——即使解释近乎完美(ξ→1)
  • 若理解解释本身耗费认知(如长篇文字解释),决策者可能干脆忽略解释、把机器当黑箱,此时过度依赖最严重、准确性最低
  1. Guo, Y., Zhao, Z., Liu, X., Yu, X., Ma, Q., Zhou, D., & Xue, X. (2026). From script to stage: Automating experimental design for social simulations with LLMs. Findings of the Association for Computational Linguistics: ACL 2026, 15897–15916. https://doi.org/10.18653/v1/2026.findings-acl.780 

  2. Boyacı, T., Canyakmaz, C., & De Véricourt, F. (2026). Beyond the black box: Unraveling the role of explainability in human-artificial intelligence collaboration. Management Science, mnsc.2024.7450. https://doi.org/10.1287/mnsc.2024.07450