董梧铮
实习详情

清华大学 · 认知智能实验室

大模型算法工程师实习生
2026.06 — 至今

部门与业务背景

清华大学认知智能实验室聚焦大语言模型推理、对齐与智能体方向的前沿研究。实习期间围绕"对话智能体的后训练优化"与"用户理解"两个课题展开,目标是提升多轮对话场景下模型的行为一致性与拟人化程度。

核心职责与成果

LLM Agentic RL 后训练优化

  • 基于多轮对话轨迹数据,设计奖励模型与过程监督信号,利用强化学习(RLHF / RLAIF 路线)对模型进行后训练优化
  • 针对智能体在长链路任务中"中途偏离目标"的问题,引入轨迹级 credit assignment 机制,使奖励更精准地回溯到关键决策步
  • 构建自动化评测流水线,从任务完成率、回复一致性、指令遵循度等维度量化后训练收益

对话画像聚类算法

  • 研发基于 LLM Embedding 的用户对话画像表示方法,将海量多轮对话压缩为语义一致的低维向量
  • 设计层次化聚类流程,自动识别用户意图模式与身份群体,为个性化应答与运营策略提供数据支撑

拟人化评测体系

  • 参与构建多维拟人化评测框架,覆盖语气稳定性、人格一致性、情感适配性等细粒度指标
  • 通过人工标注 + 模型打分双轨校验,建立可复用的拟人化质量基线

技术栈

LLM Post-trainingRLHF / RLAIF强化学习Embedding 层次化聚类PyTorch评测体系多轮对话
← 返回主页实习列表