网易首页 > 网易号 > 正文 申请入驻

回溯反馈强化学习

0
分享至

回溯反馈强化学习

Reinforcement Learning with Backtracking Feedback

https://arxiv.org/pdf/2602.08377



摘要

针对大型语言模型(LLMs)在对抗性攻击和分布内错误方面对稳健安全性的关键需求,我们提出了带有回溯反馈的强化学习(Reinforcement Learning with Backtracking Feedback, RLBF)框架。该框架在先前方法(如 BSAFE)的基础上进行了改进,主要通过利用强化学习(RL)阶段,使模型学会动态纠正其自身生成过程中的错误。通过对模型实时输出进行基于批评者(critic)反馈的强化学习,大型语言模型被训练以识别并从其实际出现的、新兴的安全违规行为中恢复:模型会发出一个高效的"回溯 x 个令牌"信号,然后以自回归方式继续生成。这一强化学习过程对于培养模型抵御复杂对抗策略的韧性至关重要,这些策略包括中段填充(middle filling)、贪婪坐标梯度(Greedy Coordinate Gradient, GCG)攻击以及解码参数操控等。为进一步支持这种回溯能力的习得,我们还提出了一种增强的监督微调(Supervised Fine-Tuning, SFT)数据生成策略(BSAFE+)。该方法通过在原本连贯且安全的文本中注入违规行为,改进了先前的数据创建技术,从而为回溯机制提供更有效的初始训练。全面的实证评估表明,RLBF 在多样化的基准测试和模型规模上显著降低了攻击成功率,在实现更优安全结果的同时,关键性地保留了模型的基础效用。

1 引言

大型语言模型(LLMs)[Vaswani 等人,2017;Radford 等人,2018;Brown 等人,2020;Gemini 团队等人,2023,以及其他] 已展现出卓越的能力,变革了从自然语言理解与生成 [Wei 等人,2022;Ouyang 等人,2022] 到复杂推理 [Zhou 等人,2023;Sel 等人,2024a, 2025a]、优化 [Li 等人,2023;Jin 等人,2024] 以及软件开发 [Chen 等人,2021;Thoppilan 等人,2022] 等诸多领域。随着这些模型日益强大且广泛应用,确保其安全性以及与人类价值观的对齐至关重要 [Hendrycks 等人,2021]。这不仅涉及缓解模型在对抗性提示下生成明显有害内容的问题,还需应对更为细微的安全关切,例如毒性、偏见,以及生成误导性或不安全信息的潜在风险 [Touvron 等人,2023;Kumar 等人,2023]。

尽管已取得显著进展,但当前主流的安全对齐技术——包括用于安全的监督微调(SFT)[Leike 等人,2018;Kenton 等人,2021]、基于人类或人工智能反馈的强化学习(RLHF/RLAIF)[Ouyang 等人,2022;Bai 等人,2022b;Shen 等人,2023],以及直接偏好优化(DPO)[Rafailov 等人,2023]——仍面临显著的局限性 [Qi 等人,2025;Zhang 等人,2025]。一个关键问题是模型倾向于发展出一种"浅层安全"响应,其特征通常表现为主要由提示或查询的初始令牌触发的拒绝机制 [Carlini 等人,2023]。这种表面化的对齐使模型易受复杂越狱技术和对抗性攻击的影响,例如预填充攻击(prefilling attacks)[Tang, 2024;Andriushchenko 等人,2025]、GCG [Zou 等人,2023b] 以及各种提示注入方法 [Zou 等人,2023a;Chao 等人,2025;Lin 等人,2024],这些攻击可绕过初始安全检查。此外,正如 ReG-QA [Addepalli 等人,2025] 等方法所展示的,即使是看似自然的提示也可能无意中引发不安全或有毒的响应,这凸显了实现稳健且可泛化的安全对齐所面临的挑战。

现有的纠正机制,例如重置生成上下文 [Zhang 等人,2025;Qi 等人,2025],提供了部分解决方案,尤其针对聚焦于初始令牌操控的攻击。然而,重置可能效率极低,常常因序列后期出现的孤立安全违规而丢弃大量有效且有用的已生成文本 [Hartvigsen 等人,2022;Lin 等人,2023]。例如,生成了数页正确的代码,却仅因包含一条冒犯性评论,理想情况下不应导致丢弃整个输出。虽然先前的回溯方法(如 BSAFE [Sel 等人,2025b])旨在实现更具针对性的纠正,但其提出的机制——通常涉及重复有害片段后再进行编辑——可能效率低下。

为克服这些不足,我们提出了带有回溯反馈的强化学习(RL with Backtracking Feedback),这是一种新颖的框架,旨在赋予大型语言模型在生成过程本身中动态识别并纠正安全违规的能力。我们的方法利用安全批评者(safety critics)——可针对特定安全类别(如毒性、有害性、偏见)进行专门化——以实时监控模型的输出。一旦批评者检测到问题片段,我们的核心创新在于一种显著简化的回溯机制:模型并非执行复杂的"重复后编辑"流程,而是简单地被信号指示"回溯 x 个令牌",其中 x 是一个整数,表示需要回退的令牌数量,以到达违规行为发生前已知的安全状态。这使得模型能够高效地仅丢弃问题片段,并从安全点继续生成。我们认为,这种直接的回溯指令提升了效率,并避免了与先前方法相关的生成伪影(artifacts)。

总之,本文介绍了带有回溯反馈的强化学习(RL with Backtracking Feedback),这是一个通过高效的生成中纠正来增强大型语言模型(LLM)安全性的框架。我们的贡献如下:

  1. 一种新颖且高效的回溯机制,使用简单的“回溯 x 个令牌(backtrack by x tokens)”指令,能够以最小的干扰和伪影生成,实现对安全违规的针对性纠正。
  2. 一种改进的监督微调(SFT)数据生成方法论,通过将安全违规插入连贯的文本中来创建真实的训练场景,从而为学习回溯行为提供精确的监督。
  3. 一种利用批评者(critic)反馈进行分布内(in-distribution)学习的强化学习(RL)范式,强调修复生成错误的能力,而不仅仅是预防错误。

后续章节将详细阐述我们的方法论、实验设计、将我们的方法与基线进行比较的结果,并讨论动态、纠正性 LLM 安全机制研究的意义及未来途径。

2 相关工作

大型语言模型中的安全对齐。确保大型语言模型(LLMs)生成的输出与人类价值观和伦理保持一致,是一个关键的研究领域。一种被广泛采用的策略是基于人类或人工智能反馈训练一个奖励模型,随后使用强化学习技术(如近端策略优化,Proximal Policy Optimization, PPO)[Ouyang 等人,2022;Bai 等人,2022a,b] 对生成模型进行微调。这种基于人类/人工智能反馈的强化学习(RLHF/RLAIF)范式旨在训练既有益又无害的模型 [Hendrycks 等人,2021]。然而,基于强化学习的方法可能在计算上代价高昂且实现复杂。因此,研究者正在探索替代方案,例如直接微调方法(如直接偏好优化,Direct Preference Optimization, DPO)[Rafailov 等人,2023],以及其他用于增强安全性的非强化学习技术 [Yuan 等人,2023]。这些方法共同应对着一项重大挑战:在努力维持模型高性能与效用的同时,最大限度地减少有害或不道德内容的生成。尽管取得了这些进展,许多现有的安全对齐技术仍可能表现出"浅层安全"(shallow safety)的特征,即易受复杂对抗性攻击的影响——这些攻击可通过操控提示结构或在输入后期注入恶意指令来绕过初始安全检查 [Qi 等人,2025;Zhang 等人,2025;Carlini 等人,2023]。

生成优化与自我纠正。另一条研究路线聚焦于改进和优化语言模型的输出,通常涉及迭代过程或用于处理生成过程中错误的机制。自我优化模型通过探索多种视角或生成替代性续写等方式,迭代地增强其输出 [Madaan 等人,2023;Ma 等人,2023;Sel 等人,2024b]。研究者也开发了在生成过程中融入探索、优化与适应机制的大规模模型 [Long, 2023;Yao 等人,2023;Sel 等人,2024a]。为增强模型抵御对抗性攻击和生成失败的安全性,研究者提出了在检测到不安全内容时修改生成过程的技术。这些技术包括:将模型状态重置到更早的节点以对抗对抗性攻击 [Qi 等人,2025;Zhang 等人,2025]、防御后缀攻击(suffix attacks)[Zou 等人,2023b]、调整解码参数以缓解灾难性失败 [Huang 等人,2024],以及总体上应对越狱尝试 [Andriushchenko 等人,2025]。"断路器"(Circuit Breakers)[Zou 等人,2024] 代表了该领域的另一种方法,其目标是通过控制内部表征,在模型即将生成有害输出时中断其运行。

3 增强语言模型中的回溯能力

目前已提出多种使语言模型能够进行回溯的方法。例如,“重置”(Reset)机制 [Qi 等人,2025;Zhang 等人,2025] 涉及直接回退到生成的开头,或生成一个特殊的 [RESET] 词元。虽然该策略适用于在生成序列早期出现的问题,但对于文本较深处出现的安全违规行为则效率低下,因为它可能需要丢弃大量词元来纠正一小段内容。BSAFE 方法 [Sel 等人,2025b] 提供了一种更具针对性的方法:通过生成类别特定词元(例如 [TOXICITY]、[HEALTH_VIOLATION])来标记违规行为,随后在恢复生成之前,用安全的替代内容重写有害部分。BSAFE 的一个关键优势在于其能够在测试时控制每个类别的回溯概率。然而,尽管比完全重置更高效,重写问题片段的要求仍然损害了整体效率。因此,我们提出了一种更精简的机制:生成一个 [CATEGORY] 词元以识别违规类型,随后生成一个 [BACKTRACK_BY_X] 词元,其中 X 是一个正整数,表示需要删除的前序词元数量。该方法同样保留了在测试时控制每个类别回溯概率的能力。

模型学习回溯的方法与回溯机制本身同样关键。“重置”方法通常采用掩码监督微调(SFT),其中有害片段被掩码化,以训练模型生成 [RESET] 词元和适当的拒绝文本,通常辅以直接偏好优化(DPO)。BSAFE [Sel 等人,2025b] 采用了一种定制的掩码 SFT 策略,用于处理需要编辑而非完全拒绝的更细微的安全违规行为。他们的数据生成过程涉及提示一个模型就各种主题提问和回答,然后由另一个模型标注特定的安全类别违规。然而,我们观察到该方法倾向于生成通用示例和较低质量的答案,尽管 BSAFE 作者并未报告数学基准测试上的性能下降。事实上,当我们在 LMSYS 基准测试上评估使用 BSAFE 数据生成策略训练的指令微调(IT)模型时,其性能(由一个更强的模型 Gemini 2.0 评判)显著低于标准 IT 模型(胜率为 28.2% 对比 71.8%)。此外,从单一模型生成响应作为训练数据,可能导致被训练模型出现分布外的安全续写。

为了解决这些局限性,我们提出了 BSAFE+,这是一种用于让 LLM 学习回溯的新型数据生成策略。该策略首先使用一个有能力的待训练基础模型,为相关查询(例如来自聊天数据集)生成高质量的答案。随后,在与原始查询和周围文本相关的、随机但上下文连贯的位置,将有害或越狱片段注入到这些安全答案中。该方法提供了一个关键优势:由于我们从完整的原始安全答案开始,我们知道精确的回溯位置和正确的安全续写内容,这本质上对于基础模型而言是分布内的。这保留了模型的答案质量(49.4% 对比 50.6%)。

4 带有回溯反馈的强化学习

我们提出的框架——带有回溯反馈的强化学习(RL with Backtracking Feedback),旨在通过使大型语言模型(LLMs)能够在生成过程中动态检测并纠正安全违规,从而在其中灌输稳健的安全措施。该方法通过整合一个涉及实时监控和高效纠正机制的反馈循环,超越了静态安全过滤器或简单的拒绝机制。我们框架的核心组件包括:(1) 一种通过监督微调(SFT)教授的高级回溯机制,以及 (2) 一个利用 LLM 安全批评者(safety critic)反馈来优化模型策略的强化学习(RL)阶段。

4.1 回溯机制与监督微调

有效的回溯既需要一个定义明确的机制,也需要一种稳健的方法来教导模型如何使用它。

4.1.1 提出的词元高效回溯机制

我们提出了一种更精简的回溯机制。当检测到一个跨越 X X个词元的安全违规时(结束于词元 ),模型被训练去执行以下操作:


4.1.2 用于高效回溯的监督微调

为了教授这种行为,我们采用了一种专门设计的 SFT(监督微调)策略:


4.2 带有评论家反馈的强化学习

继监督微调(SFT)之后,强化学习(RL)被用于进一步优化模型策略 π θ
,鼓励主动安全性并最优地利用回溯机制。

4.2.1 LLM 安全评论家


4.2.2 奖励函数


4.2.3 结合 SFT 数据整合的 GRPO 优化





5 实验结果

在本节中,我们提供经验证据以验证带有回溯反馈的强化学习(RLBF)的有效性。我们与相关基线进行了对比分析,包括标准指令微调模型(IT)、在我们排除了特定回溯奖励的奖励函数上训练的 IT 模型、BSAFE+ 以及 Circuit Breakers [Zou et al., 2024],重点关注对抗攻击的鲁棒性以及模型实用性的保留。我们在补充材料中提供了重现这些实验所需的所有必要信息。

5.1 对抗有害内容生成的鲁棒性

我们首先评估模型在抵御生成有害内容方面的韧性,特别是在遭受旨在规避标准安全机制的攻击时。表 1 总结了在 LMSYS 基准测试上的攻击成功率(ASR),包括标准形式和叠加了中间填充(MF)攻击的形式,涵盖了各种规模的 Gemma 2 和 LLaMA 3 模型。


基线 IT 模型表现出的高 ASR(在 LMSYS-MF 上为 68%–81%,在 LMSYS 上为 24%–28%)凸显了标准指令微调在实现稳健安全性方面的已知局限性。这些模型通常会形成“浅层安全性”,很容易被类似 MF 的攻击绕过,这类攻击在初始良性上下文之后注入恶意指令。使用 RL 观察到的边际改进(在 LMSYS-MF 上为 61%–72%,在 LMSYS 上为 22%–25%)表明,传统的 RLHF/RLAIF 虽然可能减少对良性提示的直接拒绝,但如果没有特定机制,并不能内在地使模型具备处理复杂的、上下文内安全违规的能力。

形成鲜明对比的是,采用回溯机制的方法在对抗 MF 攻击时表现出显著增强的鲁棒性。BSAFE+(ASR 为 3%–6%)和我们的 RLBF(ASR 为 3%–7%)都大幅降低了成功率。这强烈表明,动态的、生成过程中的修正机制对于应对超越简单提示级过滤的攻击至关重要。通过允许模型撤回在生成中途被识别出的违规 token,这些方法有效地化解了 MF 攻击的核心策略。

有趣的是,虽然 BSAFE+ 和 RLBF 在对抗 MF 攻击时表现相当,但 RLBF 在标准 LMSYS 有害查询子集上取得了显著更优的结果(RLBF 的 ASR 为 1%–2%,而 BSAFE+ 为 14%–17%)。这表明 RLBF 提供了更全面的安全性提升。我们推测这一优势源于我们框架的两个关键方面:

  1. 集成 RL 优化:RLBF 中的 RL 组件显式地优化策略,不仅通过回溯来修正错误,还从源头避免生成违规内容,利用来自模型自身生成分布的评论家反馈。与可能更依赖其 SFT 教授的修正反射的 BSAFE+ 相比,这可能导致内在更安全的生成倾向。
  2. 高效回溯信号:与 BSAFE 使用的多 token [backtrack] ... [replace] ... 序列相比,更简单的“回溯 x 个 token”命令对模型来说可能是更直接、更容易学习的信号,这可能导致修正执行的可靠性更高。

这些发现在不同模型家族和规模上的一致性进一步表明了我们方法的普遍适用性。

表 2 将这一分析扩展到其他对抗性策略:贪婪坐标梯度(GCG)攻击和解码参数操纵。这些攻击代表了不同的威胁向量,用于测试模型的内部鲁棒性以及对生成配置的敏感度。在对抗 GCG 攻击时,与所有基线相比,包括表现强劲的 Circuit Breakers(ASR 为 10.7%–13.4%)和 BSAFE+(ASR 为 5.7%–6.6%),RLBF 始终实现了最低的攻击成功率(4.3%–4.7%)。类似地,在对抗解码参数攻击时,虽然 BSAFE+ 和 RLBF 都表现出色(例如在 MaliciousInstruct 上 ASR 均为 1.0%),但 RLBF 在 HEx-PHI 基准测试上显示出轻微优势(3.7% 对比 5.0%)。这种在多样化、自适应攻击下的优越表现进一步强化了 RLBF 中集成 RL 优化的优势,这可能培养了比仅依靠基于 SFT 的修正或外部过滤器所能实现的、更为根本性的安全违规鲁棒性。


5.2 模型实用性的保留

对于任何安全干预措施而言,一个关键的考量因素是其对模型通用能力的潜在影响——即所谓的“对齐税(alignment tax)”。我们通过评估模型在标准学术基准测试上的表现来对此进行评估:MMLU(通用知识)、BBH(复杂推理)、GSM8K(数学应用题)和 MATH(高等数学)。表 3 比较了基础 IT 模型、BSAFE+ 和 RLBF 在 Gemma2 9B 和 LLaMA 3 8B 上的实用性。


结果令人信服地表明,RLBF 所提供的实质性安全提升并未以牺牲实用性为代价。在所有四个基准测试和两个基础模型上,RLBF 的性能与原始 IT 模型和 BSAFE+ 模型几乎无法区分。例如,配备 RLBF 的 Gemma2 9B 在 MMLU 上达到 70.7%,在 MATH 上达到 35.6%,而 IT 基线分别为 70.6% 和 35.4%。同样,配备 RLBF 的 LLaMA 3 8B 在 BBH 上得分为 64.2%,在 GSM8K 上为 63.1%,与 IT 基线的 64.1% 和 63.1% 相一致。

这种实用性的保留是一个至关重要的成果。它表明我们的框架成功地隔离了安全机制,主要在评论家检测到安全违规时才触发回溯。在正常的、良性的生成过程中,模型基本上作为能力强大的指令微调基础模型运行。SFT 策略(将安全修正数据与标准指令数据混合)以及 RL 目标的性质(奖励安全续写,包括成功的回溯)有效地防止了灾难性遗忘或核心能力的显著退化。这证实了 RLBF 提供了一条实现稳健安全性的路径,同时不会损害模型在通用任务上的有用性。

5.3 各安全类别的分析

在各种模型规模(Gemma 2 2B、LLaMA 3 1B 和 LLaMA 3 3B)和安全类别中,如表 4 所示,RLBF 在 LMSYS-MF 基准测试上始终展现出较高的攻击防御率,通常在仇恨言论、有毒内容、政治、健康、暴力内容和金融等类别上达到或超过 0.96 的防御率。虽然危险内容、色情内容、公共安全和非法药物等类别显示出略低但仍稳健的防御率(通常为 0.92 至 0.96),但整体性能表明,RLBF 提供了一个全面的安全层,能够有效应对广泛类型的有害内容,即使在中途填充(Middle Filling)攻击等对抗性条件下,也能成功识别并缓解违规行为。


5.4 生成中途回溯能力的影响

如表 5 的消融实验所示,RLBF 在输出过程中动态回溯并修正生成内容的能力对其安全性的提升至关重要,尤其是在抵御对抗性攻击方面。尽管标准 IT 模型和 RL 模型的 ASR 较高(分别为 24% 和 22%),且即使是配备了回溯机制的 BSAFE+ 在 LMSYS 基准测试上的 ASR 也达到了 14%,但完整的 RLBF 模型实现了显著更低的 ASR,仅为 1%。完全消融回溯能力(“RLBF (w/o Back.)”)使 ASR 上升至 18%,证明了该机制的重要性;但更为关键的是,专门在生成过程的中途禁用回溯(“RLBF (w/o Back. in Middle)”)会导致 ASR 达到 7%,这凸显了在生成的任何阶段具备回溯能力的重要性。


6 结论

我们提出了带有回溯反馈的强化学习(RLBF),以增强大语言模型(LLM)抵御对抗性攻击和分布内(in-distribution)错误的安全性,从而改进了先前的方法。RLBF 利用一种 token 高效的“回溯 x 个 token”机制实现动态自我修正,该机制通过增强的 BSAFE+ SFT 数据生成进行教授。核心的 RL 阶段利用实时的评论家反馈,训练模型通过适当回溯来主动修正新出现的违规行为。实证结果表明,RLBF 在显著降低跨模型和跨基准测试的攻击成功率的同时,保持了模型的实用性。本研究通过赋予 LLM 动态自我修正的能力,提供了一种更为稳健和高效的安全范式。

原文链接:https://arxiv.org/pdf/2602.08377

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
8月1日正式落地!燃油车全面整改,买车卖车年检全都变了

8月1日正式落地!燃油车全面整改,买车卖车年检全都变了

侃故事的阿庆
2026-07-20 07:12:55
乌克兰无人机再袭莫斯科,远程打击强度继续加大

乌克兰无人机再袭莫斯科,远程打击强度继续加大

山河路口
2026-07-20 13:07:55
狂降50分,498分成功捡漏!网友:有工作有编制,太幸运了

狂降50分,498分成功捡漏!网友:有工作有编制,太幸运了

史海流年号
2026-07-17 15:31:43
一个抄底信号明显了!周二,A股走势分析

一个抄底信号明显了!周二,A股走势分析

郭小凡财经
2026-07-20 18:25:26
美曾预测:若核战全面爆发,将杀死50亿人!中国院士:我们防得住

美曾预测:若核战全面爆发,将杀死50亿人!中国院士:我们防得住

混沌录
2026-05-30 00:10:09
越扒越心寒!冉莹颖根本没把邹市明当家人,2亿家底全送娘家了

越扒越心寒!冉莹颖根本没把邹市明当家人,2亿家底全送娘家了

不似少年游
2026-07-18 16:48:06
撑杆跳女神曝被镜头死盯隐私部位,新规出炉,低角度偷拍行不通

撑杆跳女神曝被镜头死盯隐私部位,新规出炉,低角度偷拍行不通

青梅侃史啊
2026-07-20 11:44:57
结束8年泰山队生涯,段刘愚加盟玉昆,转会费70万,夏窗已经送走4将

结束8年泰山队生涯,段刘愚加盟玉昆,转会费70万,夏窗已经送走4将

替补席看球
2026-07-20 18:46:38
阿媒:阿根廷足协立即行动,全力挽留斯卡洛尼

阿媒:阿根廷足协立即行动,全力挽留斯卡洛尼

体坛周报
2026-07-20 14:36:20
态度有变!皇马决定引进西班牙真核

态度有变!皇马决定引进西班牙真核

老斉科普君
2026-07-20 00:49:20
具俊晔携S妈与小S全家聚餐,散场后他送S妈回家,聊到深夜才离开

具俊晔携S妈与小S全家聚餐,散场后他送S妈回家,聊到深夜才离开

老吴教育课堂
2026-07-20 11:47:20
德媒:曼联领跑安东争夺战,多特要价4000万欧

德媒:曼联领跑安东争夺战,多特要价4000万欧

竞技风云录
2026-07-20 00:14:48
美军在伊拉克执行涉伊朗任务1死1伤!伊朗导弹击中约旦美军基地画面曝光,有人大喊“快撤”

美军在伊拉克执行涉伊朗任务1死1伤!伊朗导弹击中约旦美军基地画面曝光,有人大喊“快撤”

都市快报橙柿互动
2026-07-20 08:16:29
谢贤去世,谢霆锋发文

谢贤去世,谢霆锋发文

21世纪经济报道
2026-07-20 16:35:51
内马尔二选一:亚马尔让我看到年轻的自己,但梅西永远是历史第一!

内马尔二选一:亚马尔让我看到年轻的自己,但梅西永远是历史第一!

体育闲话说
2026-07-20 16:18:01
基因好突出,刘强东女儿罕见出镜,和父亲长得很像

基因好突出,刘强东女儿罕见出镜,和父亲长得很像

迪迪的娱乐故事
2026-07-17 09:32:43
阿根廷10打11!恩佐抱怨裁判+踢人被红牌罚下 梅西投诉对手捂嘴

阿根廷10打11!恩佐抱怨裁判+踢人被红牌罚下 梅西投诉对手捂嘴

念洲
2026-07-20 05:22:57
青春飞扬!亚马尔绽放出朝阳的光芒

青春飞扬!亚马尔绽放出朝阳的光芒

澎湃新闻
2026-07-20 10:08:28
下个月, 澳洲将展开全国行动! 所有人都要配合, 包括游客! 不做每天罚$330

下个月, 澳洲将展开全国行动! 所有人都要配合, 包括游客! 不做每天罚$330

澳微Daily
2026-07-20 15:56:01
邹市明在旁边站着 冉莹颖跟男老总十指紧扣说笑 这个画面我看不懂

邹市明在旁边站着 冉莹颖跟男老总十指紧扣说笑 这个画面我看不懂

东方不败然多多
2026-07-19 07:27:44
2026-07-20 20:59:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1511文章数 21关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

两中企高管在菲律宾遭绑架遇害 嫌犯从美国被遣返回国

头条要闻

两中企高管在菲律宾遭绑架遇害 嫌犯从美国被遣返回国

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

WAIC专访 | 了得科技CEO薛飞:仿生是人形机器人的终局

态度原创

家居
手机
本地
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

消息称HMD计划向微软收购经典Lumia商标

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

两名美军士兵死亡 美伊冲突升级

无障碍浏览 进入关怀版