基于SAA的边界感知共识学习模型研究

Abstract

随着大语言模型在情感陪伴类场景中的广泛应用,如何保持AI角色一致性成为当前研究的关键问题。本文提出一种受RLHF启发的边界感知共识学习模型,并设计了人机依恋安全监管框架(ASSF),以减少因SAA监管过敏引发的用户期待落差。本文的创新在于:建立BPCL,提出可量化的AI失衡指标,并通过ASSF实现对AI的边界感知与安全调节。该研究为情感型AI在体验连续性与安全性之间的平衡提供了新思路。

Keywords

References

  1. 张钦彤,王昱超,王鹤羲,等.大语言模型微调技术的研究综述[J].计算机工程与应用,2024,60(17):17-26.
  2. Ji Ke, Lian Yixin, Li Linxu, Gao Jingsheng, Li Weiyuan, Dai Bin. Role-Aware Contrastive Learning for Enhancing Role-Playing Consistency in LLMs[C].Proceedings of ACL 2025,pp. 26221–26238.
  3. 邓胜利,贾瑞琪.基于情感三层次理论的陪伴式AI用户体验研究[J/OL].情报理论与实践.2025-08-29. https://link.cnki.net/urlid/11.1762.G3.20250828.1710.004
  4. Xu P, Nowzari C, Tian Z. A class of distributed event-triggered average consensus algorithms for multi-agent systems [J]. International Journal of Control, 2020, 93(8): 1934-1952.
  5. OpenAI. Deliberative Alignment: Reasoning Enables Safer Language Models [EB/OL]. 2024. https://arxiv.org/abs/2412.16339.
  6. 代宝,杨泽国.基于扎根理论的社交媒体用户信息规避动机研究——以微信为例[J].情报理论与实践,2023,46(6):118-126.