实习详情
清华大学 · 认知智能实验室
部门与业务背景
清华大学认知智能实验室聚焦大语言模型推理、对齐与智能体方向的前沿研究。实习期间围绕"对话智能体的后训练优化"与"用户理解"两个课题展开,目标是提升多轮对话场景下模型的行为一致性与拟人化程度。
核心职责与成果
LLM Agentic RL 后训练优化
- 基于多轮对话轨迹数据,设计奖励模型与过程监督信号,利用强化学习(RLHF / RLAIF 路线)对模型进行后训练优化
- 针对智能体在长链路任务中"中途偏离目标"的问题,引入轨迹级 credit assignment 机制,使奖励更精准地回溯到关键决策步
- 构建自动化评测流水线,从任务完成率、回复一致性、指令遵循度等维度量化后训练收益
对话画像聚类算法
- 研发基于 LLM Embedding 的用户对话画像表示方法,将海量多轮对话压缩为语义一致的低维向量
- 设计层次化聚类流程,自动识别用户意图模式与身份群体,为个性化应答与运营策略提供数据支撑
拟人化评测体系
- 参与构建多维拟人化评测框架,覆盖语气稳定性、人格一致性、情感适配性等细粒度指标
- 通过人工标注 + 模型打分双轨校验,建立可复用的拟人化质量基线