面向时序异常检测的 LLM 后训练
围绕用户意图对齐与细粒度异常定位,研究可控轨迹合成、Agentic RL、多轮工具调用和 VLM 主动感知。
查看相关工作 →我是清华大学计算机科学与技术系博士生,目前在 NetMan Lab 开展研究,导师为 裴丹教授。我的研究聚焦于LLM 后训练、Agentic RL、多模态 LLM 对齐与推理,及其在智能运维中的应用。
我近期主要研究面向时间序列异常检测的 LLM 后训练,围绕用户意图对齐、记忆检索、多轮工具调用与 VLM 主动感知,提升模型在复杂异常检测任务中的推理与决策能力。在此过程中,我进一步关注到策略更新与轨迹生成不同步带来的 Off-Policy 问题,并将研究拓展至面向 LLM 后训练与长程 Agentic RL 的 Off-Policy 优化,重点缓解策略滞后与历史轨迹偏移对训练的影响。
我于 2023 年获得清华大学计算机科学与技术学士学位,曾在字节跳动、华为、中兴、eBay 和瑞莱智慧开展算法研究实习。已以第一作者发表两篇 ICML 2026 论文,另有两项第一作者研究工作在投。
当前研究主要围绕 LLM 后训练、Agentic RL、多模态推理及其在智能运维中的应用展开。
围绕用户意图对齐与细粒度异常定位,研究可控轨迹合成、Agentic RL、多轮工具调用和 VLM 主动感知。
查看相关工作 →研究 LLM 强化学习和长程 Agentic RL 中由策略滞后、旧轨迹复用与历史决策累积引发的 Off-Policy 问题。
当前研究方向研究如何将时间序列作为原生模态接入 LLM,并支持跨模态对齐、推理与高效部署,同时构建结构化根因推理能力。
查看相关工作 →面向运维领域构建高质量评测数据、综合基准与自动评分方法,提升领域 LLM 的评测可靠性。
查看相关工作 →近期研究进展与论文录用。
完整列表见 Google Scholar。
以意图解析、记忆检索和工具执行构成多步 Agent 决策链,并通过 Agentic RL 提升模型遵循业务意图和完成多步决策的能力;已部署于字节实际开发环境。
以 Qwen3.5-9B 为底座构建多轮检查 Agent。模型先从全局视图筛选候选区域,再并行获取高分辨率局部证据,并结合多轮结果逐步精化异常边界、自主判断何时停止;通过可控数据合成与两阶段 SFT + GRPO 训练获得主动感知能力。

研究主题时间序列预测与推理增强
首个对近期观测异常保持鲁棒的时间序列预测模型。工作分析了现有模型对近期数据的捷径依赖,并结合随机采样的全局上下文建模、可学习周期提取与两阶段训练提升预测鲁棒性。

研究主题时间序列预测与推理增强
提出无需训练的推理时增强框架,利用降采样与样条插值扩展基础模型可利用的上下文长度;预测精度提升 19%,同时将峰值显存和推理时间分别降至原来的 1/6.4 与 1/16.9。

研究主题AIOps 根因定位
MicroScope 面向复杂内部系统,在隐空间中建模系统指标之间的因果关系,并通过干预识别定位根因;算法已完成工程化应用。

研究主题多模态 LLM 对齐与推理
首批面向故障诊断推理的 LLM 基础模型之一。该工作将多模态语义特征、异常波动与传播关系组织为结构化推理链路,并通过 GRPO + RLVR 提升模型在未见故障类型上的泛化能力与可解释性。

研究主题多模态 LLM 对齐与推理
首个将时间序列作为原生新模态接入 LLM 的多模态模型。该工作通过 SFT 实现跨模态对齐,并扩展 vLLM 以支持新模态的高效推理;截至 2026.8,项目已获 470+ GitHub Stars、120+ 引用与超过 2 万次模型下载。

研究主题LLM 评测与 AIOps
面向 AIOps 领域构建综合评估基准,包含 9,000+ 问答,覆盖 8 个子领域与多种评测范式;同时提出与专家判断对齐的问答评分指标 FAE-Score。

研究主题LLM 评测与 AIOps
面向多层级运维文档自动构建评测数据集。该框架结合种子数据合成、分层文档召回与一致性验证,提升评测数据的专业性和证据可追溯性;已部署于华为实际开发环境。

研究主题LLM 评测与 AIOps
通过关键术语匹配、步骤顺序验证和完整性检验自动评估技术支持问答,AUC 相比前序最优方法提升 7.6%。

研究主题鲁棒 AI 与模型安全
通过优化带有对抗纹理的 3D 网格,攻击多种架构的人脸识别模型,并在真实环境中绕过手机解锁、智能门锁等人脸识别系统。

研究主题鲁棒 AI 与模型安全
通过在 3D StyleGAN 隐空间中优化人脸补丁,实现鲁棒的物理人脸对抗攻击。
相关工业研究经历按 LLM 工作与其他研究方向分组展示。
算法实习生。搭建面向时间序列推理的多模态 LLM 后训练与评测链路,覆盖可控数据合成、多轮工具调用轨迹构造、SFT、Agentic RL、轨迹评测、RLVR 与高效推理。同时扩展 LLaMA-Factory、VeRL、TRL GRPOTrainer 和 vLLM,使这些框架支持原生时序输入;相关工作包括 ChatTS、FoundRoot、IntentAD 与 G2AD。
算法实习生。完成 AIOps 领域语料与问答数据合成、LLM 后训练和自动评测全流程,使领域问答准确率较 Chat 基座提升超过 80%。合作论文包括 OpsEval(FSE 2025)与 TechSupportEval(IJCNN 2025);在线排行榜访问量已超过200 万。
算法实习生。围绕时间序列基础模型的鲁棒性与推理效率开展研究,重点解决模型对近期观测的捷径依赖和超长上下文受限问题;相关工作形成一作论文 TameR 与 SPRINT(ICML 2026)。
算法实习生。研究光传输网络多源时空基础模型,以及基于多层级文档的评测数据集自动构建方法;参与 Eagle(FSE 2026,CCF A),并推动部分算法完成工程化落地。
算法实习生。面向复杂内部系统研发根因定位算法,在隐空间中建模系统指标之间的因果关系,并通过干预识别定位根因。算法已完成工程化应用,相关工作形成合作论文 MicroScope(KDD 2024,CCF A)。
算法实习生。围绕人脸识别模型安全开展物理世界 3D 对抗攻击研究,包括对抗纹理网格生成与 3D 隐空间补丁优化;相关工作形成合作论文 AT3D(CVPR 2023,CCF A,Highlight)与 Face3DAdv(IJCV 2024,CCF A)。
部分奖项与荣誉。