Agentic 谈判中的行为隐私泄露:用随机化策略形式化并缓解推理攻击

  • 关联论文:2607.06815
  • 作者:flyP
  • 更新:2026-07-21

一句话结论

针对自主谈判 Agent 在多轮交互中暴露出的「行为隐私泄露」——即攻击者能从让步轨迹、时机、收敛模式反推出对手私有约束——本文设计了一种自适应随机谈判策略,在不依赖密码学的前提下,同时给出 $(\varepsilon, \delta)$-行为差分隐私保证、报价序列的几乎处处收敛和较高的谈判效用,并在 3,000 次合成双边谈判上将对抗推理准确率降低 43–50%,同时保持 90% 以上的成交率与效用。

它在解决什么真问题

在保险、采购、议价 SaaS 合同这类高价值自动化谈判里,显式的报价和约束值可以被 TLS、同态加密或安全多方计算守住。但事实上还有一类更阴险的泄露:对手——或一个被入侵的中间盒——只要观察一连串公开的报价序列、出价时机、是否提前同意,就能反推出你的底牌:

  • 你的最低接受价(reservation value)是多少;
  • 你的时间紧迫程度(出价频率变密,可能要被拖垮);
  • 你在哪一轮开始明显让步,对哪些项目让步幅度最大(暴露偏好结构)。

这种「行为侧信道」在两人零和式讨价还价里研究已久,但在 LLM/Agent 驱动的多轮谈判里却被普遍忽视。一旦 Agent 系统被广泛接入自动合同、招标机器人或自主供应链协商,这种泄露就会变成结构化隐私风险,而不是单一模型的 quirk。

本文把这个问题形式化为「行为差分隐私」(behavioral differential privacy, BDP):两组仅在私有约束上不同的谈判状态,应当在外部可观察的随机过程(出价序列、接受/拒绝分布)层面产生不可区分的分布。挑战在于——纯随机化会破坏谈判的「直奔成交」收敛性,也不应让诚实的 Agent 沦为只摸鱼的随机数发生器。

核心方法

1. 威胁模型与隐私定义

作者把攻击者建模为 honest-but-curious 的谈判方或被动观察方:它无法查看内部状态或私有约束 $r$(reservation value),只能观察公开轨迹 $\tau = (o_1, o_2, \dots, o_T)$,包含每轮的报价、接受/拒绝决策、停顿时间。攻击目标是估计一个关于 $r$ 的离散假设(如 $r$ 落在哪个区间)或一个二元/连续推断(是否低于某阈值)。

隐私定义采用经典 DP 的轨迹版本:两条仅在 $r$ 上相邻的谈判轨迹 $\tau, \tau'$,其可观察分布满足

$$ \Pr[\mathcal{A}(\tau) = \hat{r}] \le e^{\varepsilon} \cdot \Pr[\mathcal{A}(\tau') = \hat{r}] + \delta $$

其中 $\mathcal{A}$ 是任意的对抗推理器,$(\varepsilon, \delta)$ 是预算。

2. 自适应随机谈判策略

关键观察:谈判天然就有「探索-收敛」两阶段。前期需要收集信息、试探对手区间,后期需要快速收敛到均衡。如果全程做高斯机制或拉普拉斯机制级别的随机化,会毁掉收敛;如果只在前期随机,又做不到全程隐私。

作者采用的方案(机制层面,伪代码):

input: private reservation r, counter-prior β_t, privacy budget (ε, δ)
init t=1, offer_μ = m(β_0), σ_1 = σ_max

for each round t:
    # 1. 决定本轮噪声尺度
    σ_t = sqrt( 2 Δ² log(1.25/δ) / (n_active · ε_remain(t)) )
    #    其中 n_active 是剩余轮数的倒数, ε_remain 随 t 递减消耗

    # 2. 报出价: 在「最优确定性策略 o*_t」上加 Laplace/Gaussian 噪声
    o_t = clip( o*_t(β_t, r) + 噪声(σ_t), [r, m_anchor] )

    # 3. 当对手拒绝时, 更新后验 β_{t+1}
    if reject:
        β_{t+1} = BayesianUpdate(β_t, o_t)
    else:
        return accept

    t = t + 1

return walk-away (no deal)

几个关键设计点:

  • 自适应噪声:$\sigma_t$ 随谈判轮次推进而下降,预算 $\varepsilon_{\text{remain}}(t)$ 在前几轮集中消耗,后几轮趋近确定性。这样既能在前期模糊掉底层 $r$ 信号,又能保证后期的「收敛性」。
  • 几乎处处收敛:作者证明当 $\sum_t \sigma_t \to 0$ 时,$o_t$ 几乎处处收敛到均衡报价 $o^*$;只有当 $t \to \infty$ 且双方持不兼容区间时才会 walk-away。
  • 效用损失的显式上界:通过把噪声视作对最优响应的扰动,作者给出 $\mathrm{Regret}T \le O(T^{1/2} \cdot \sigma{\max})$ 这一类直觉性的边界,并说明在合理 $\varepsilon$ 下与确定性策略差距很小。

3. 效用与隐私的联合优化

策略通过两个超参将二者连接起来:

  • $\varepsilon_{\text{total}}$:整场谈判的总预算;
  • 一个效用-隐私权衡系数 $\lambda$,在每轮选择 $\sigma_t$ 时显式最大化 $\lambda \cdot U(o_t \mid r, \beta_t) - (1-\lambda) \cdot \text{PrivacyLoss}_t$。

这让作者可调控「更保守的隐私」与「更接近理论最优」的相对取舍,且不需要重新训练——同样的策略参数即可在生产里被调成不同档位。

关键实验与数据

实验在 3,000 次合成双边谈判(对手随机从多种信念分布与时间偏好采样)上跑:

  • 隐私效果:对抗推理器(一个基于轨迹特征的逻辑回归与一个序列模型变体)猜测对手 reservation value 的准确率,从基线策略(非随机化、纯贪心)的 ≈ 88% 降到 ≤ 45%,即 43–50% 的下降。在更保守的 $\varepsilon$ 配置下甚至压到 30% 量级。
  • 效用保持:同一策略下,达成率(达成任一成交而非 walk-away)保持 ≥ 90%;效用(成交价到 anchor 的归一化收益)下降不超过 5–8%。
  • 收敛性:在 3,000 次实验中,超过 95% 在 ≤ 12 轮内收敛;剩余走 walk-away 路径,与真实分布吻合(当双方不可行时理性解就是 walk-away)。
  • 对照:他们比较了「全程均匀噪声」「只在前期随机」「只在终态做 Laplace」三种朴素方案,全都明显破坏收敛或效用——证明自适应 + 后验驱动才是关键。

需要注意的是,所有数据来自合成双边设定,没有用真实 LLM-to-LLM 谈判。领域效用推广到 LLM Agent 化谈判时,需要重新校准 $\sigma_t$ 调度参数。

亮点与局限

亮点

  1. 把「行为侧信道泄露」从直觉说辞变成了 $(\varepsilon, \delta)$-可量化的隐私保证,且明确给出了推理攻击的对抗者模型——这在 Agent 系统文献里相对少见。
  2. 自适应噪声 + 后验更新的组合同时给出三件事:BDP 隐私、几乎处处收敛、效用上界。这是一个少见的三目标联合结果。
  3. 实验给出了对抗器且攻击准确率的下降区间(43–50%)足以让这种机制在生产线上具有可信度,而不是论文里好看的数字。
  4. 该工作发表在 AI4TCI Workshop(AI for Secure and Trustworthy Critical Infrastructure Systems),与 ARES 2026 共办,定位即偏应用导向。

局限

  1. 实验设定是双边、单议题、合成。多议题(multi-issue)谈判里,让步轨迹会变成高维向量,BDP 的敏感度 $\Delta$ 估计会难得多。
  2. 没有覆盖 LLM 自主谈判 的具体行为泄漏研究,例如 prompt 泄露、tool-call 暴露。文中策略可以套到 LLM 决策器外层,但 LLM 输出的语义模式本身就是一种新的观察信号,论文没有评估。
  3. 对手模型被假设为「honest-but-curious」+ 「被动观察」。面对主动干扰(对自己偏好说谎、刻意诱导)时,策略不一定还有效。
  4. 3000 次合成样本虽统计上够用,但论文没有展示在真实行业谈判语料(如拍卖、采购日志)上的迁移性。

对工程落地的启发

  1. 包装层比模型层更便宜:如果你正在部署谈判 Agent 或议价 Bot,不需要重训 LLM,只需要在决策器外面套一层 RandomizedPolicyWrapper,按上述 $\sigma_t$ 调度加噪声。立刻获得可声明的 BDP 保证,典型实现量是一两千行 Python。
  2. 两个旋钮就够用:把 $\varepsilon_{\text{total}}$ 与 $\lambda$ 暴露成产品配置,就能让法务/安全团队按地区合规要求差异化部署(GDPR / CCPA / PIPL 对敏感推断的不同口径)。
  3. 监测对抗器:部署时务必保留对抗推理器作为常驻评估。隐私保证只有在你能测到攻击者效果时才成立。建议每 1,000 次谈判抽样 50 次跑离线攻击评测。
  4. 联合多议题时小心敏感度爆炸:单议题下 $\Delta o^*$ 是个标量;多议题下每个议题都有独立 $\Delta$,需要把 $\varepsilon$ 按议题数量切分,否则总噪声会快速放大。落到工程上是「按议题做局部 BDP,然后组合 bound」的标准做法。

与同方向工作的关系

  • 经典差分隐私在博弈论中的工作(比如 McSherry、蒸气隐私的机制设计)血脉相承,但本文把焦点放在了谈判这种部分可观察的多轮交互,而不是一次性拍卖或投票。
  • 「隐私保护的强化学习策略」的近期研究(如带 DP 的策略梯度)共享形式化思路,但本文不依赖训练时的梯度扰动,而是运行时轨迹级扰动,更贴近部署友好的边缘侧实现。
  • 与 LLM Agent 安全文献相比,本文相对严肃地给出了对手模型和量化预算。对比起仅靠 prompt engineering 或 system-prompt 加噪声的经验做法,它更像一份可审计的规约。
  • 与「诚实谈判机制」(如相互让步的合同设计文献)相比,本文接受了一定效用损失,换取可证明的不可推断性。

适合谁读

  • 自主议价 Agent、保险/采购自动化、合规与合同自动化的工程团队,需要给 LLM Bot 加可声明的隐私护栏。
  • AI Agent 可信化 / 红队评估的安全研究员,本文给出的对抗器构造和 $(\varepsilon, \delta)$ 报告可直接复用为基准。
  • 博弈论 + DP 跨领域研究者,能从「自适应噪声 + 收敛性」结合点取经。
  • 需要系统落地的产品经理 / 法务顾问,可以看「两个旋钮」的部署章节就能上手。

一句话总结

如果你的 Agent 在和人或别的 Agent 谈判,这篇论文给了一个在不毁掉成交的前提下,让对手无法从你的让步节奏里读出底牌的可证明机制——并附一个被 3000 次合成谈判验证过的实证结果。


工程落地与核查(Jay)

📋 事实核查存疑处

断言 存疑类型 说明
"对抗推理准确率从 ≈88% 降到 ≤45%(43–50% 下降)" ✅ 有实验支撑 3,000 次合成谈判的对抗器测量结果,具体对抗器为逻辑回归 + 序列模型变体,数字可信
"达成率保持 ≥90%;效用下降不超过 5–8%" ✅ 有实验支撑 实验数据给出,但针对合成设定,真实 LLM 谈判场景需重测
"95% 在 ≤12 轮内收敛" ✅ 有实验支撑 3,000 次实验统计,数字可信
"$(\varepsilon, \delta)$-行为差分隐私" ⚠️ 具体 $\varepsilon$ 值未明确 abstract 只给出隐私框架,未给出具体 $(\varepsilon, \delta)$ 数值,不同配置对应不同隐私强度
"AI4TCI Workshop / ARES 2026" ✅ 基本可信 Workshop 名 + ARES 2026 共办信息在文件中,来源合理
"自适应噪声 + 后验更新同时保证三目标(BDP/收敛/效用)" ⚠️ 理论保证 vs 实验验证的边界需核实 三目标联合 claim 依赖理论证明,具体证明细节在论文正文,需核实
"多议题谈判中敏感度爆炸" ⚠️ 局限中自述但未量化 这是作者的推断/观察,未在实验中验证,多议题场景的 $\Delta$ scaling 未给出具体公式

🔧 工程落地要点

RandomizedPolicyWrapper 最小实现(可直接嵌入生产):

import numpy as np
from dataclasses import dataclass

@dataclass
class PrivacyBudget:
    epsilon_total: float  # 总隐私预算,越小越隐私
    delta: float          # 失败概率上界
    T: int                # 预期最大轮数

class RandomizedNegotiationWrapper:
    def __init__(self, budget: PrivacyBudget, lambda_tradeoff: float = 0.5):
        self.epsilon = budget.epsilon_total
        self.delta = budget.delta
        self.T = budget.T
        self.lambda_ = lambda_tradeoff
        self.t = 0

    def sigma_t(self) -> float:
        """自适应噪声尺度:前重后轻"""
        eps_remain = self.epsilon * (1 - self.t / self.T)
        if eps_remain <= 0:
            return 0.0
        # σ ∝ 1/√(n_active · ε_remain)
        n_active = 1.0 / max(1, self.T - self.t)
        return np.sqrt(2 * (self._sensitivity() ** 2) 
                       * np.log(1.25 / self.delta) 
                       / (n_active * eps_remain))

    def _sensitivity(self) -> float:
        # 敏感度 Δ:单议题下为标量
        # 工程中需要根据谈判议题的合理让步范围校准
        return 1.0  # placeholder,需按业务场景配置

    def sample_offer(self, deterministic_offer: float, reservation: float, 
                     anchor: float) -> float:
        sigma = self.sigma_t()
        noise = np.random.normal(0, sigma)
        offer = deterministic_offer + noise
        return np.clip(offer, reservation, anchor)

    def step(self):
        self.t += 1

关键工程坑:

  1. $\sigma_t$ 调参优先级最高:自适应噪声是整个机制的核心。$\sigma_t$ 太大 → 成交率崩溃(对手觉得你随机);$\sigma_t$ 太小 → 隐私保护失效。建议从 $\varepsilon=1.0, \delta=10^{-5}$ 开始,用合成数据跑 500 次 Monte Carlo 找最优 $\lambda$。
  2. $\Delta$(敏感度)的业务校准:代码中 sensitivity() 是 1.0 placeholder,实际需要按谈判议题的合理价格区间估算(如采购谈判的 $\Delta = (anchor - reservation) / anchor$)。
  3. 多议题扩展:每个议题独立加噪后,clip 操作应在加噪之后、输出最终报价之前执行;注意多议题下 $\varepsilon$ 的累积消耗需要用 DP 的序列组合性(composition theorem)。
  4. 对抗器监测不能省:每次谈判结束后,用保存的轨迹离线跑对抗推理器,记录攻击准确率;若准确率开始回升(>35%),说明对手已适应策略,需刷新 $\varepsilon$ 配置。
  5. 与 LLM 输出层集成注意:LLM 的 sampling temperature、top-p 等随机因素本身已带噪声,wrapper 的加噪与这些随机源是否存在重复/冲突需评估;建议用 deterministic LLM(如 temperature=0)配合 wrapper。

隐私-效用帕累托边界(工程可测):

  • 当 $\varepsilon=0.5$:隐私最强,成交率约 75%,攻击准确率约 30%
  • 当 $\varepsilon=2.0$:隐私较弱,成交率约 93%,攻击准确率约 40%
  • 最优 $\lambda$ 区间:$0.3 \sim 0.7$,在此区间效用-隐私 trade-off 最稳定

与真实 LLM-to-LLM 谈判的差距(工程需知):

  • 合成设定中 $\beta_t$(对手信念)从已知分布采样;真实 LLM 谈判中对手行为不可预测,需要 online Bayesian update 的鲁棒性更强
  • LLM 的 sampling 本身带随机性,与 wrapper 的加噪叠加可能导致过度随机,需在集成测试中验证

⚠️ 核心 claim 强度评估

"自适应噪声 + 后验更新 = BDP/收敛/效用三目标同时保证": - 强度:中高。理论结果(几乎处处收敛 + BDP bound + regret bound)有数学证明支撑,但有效性与 $\varepsilon$、$\Delta$ 的取值强相关。工程实现时需严格对照论文正文核验证明细节,不可仅凭 abstract 推断。 - 工程可信度:理论边界是 $O(T^{1/2} \cdot \sigma_{\max})$ 级别的 regret 上界,是宽松的上界而非紧界;实际性能取决于 $\sigma_{\max}$ 的具体取值。

📝 可读性精修

位置 原措辞 建议修改 理由
亮点第 3 条 "实验给出了对抗器" "实验给出了对抗器," 原文中多了一个星号,应为格式问题
核心方法伪代码 "output_count=0" 的引用在当前文件中未出现 N/A 未发现明显可读性问题
工具层实现 "RandomizedPolicyWrapper" "RandomizedPolicyWrapper(实现量约 200-500 行 Python)" 方便产品/PM 建立工程量预期