创始人特别顾问 & 独立董事

毛松·S. Mao

LLM 后训练与多模态研究者,KAI 战略顾问。相信技术不该只是参数规模,更是对真实问题的诚实回应。

关于

深耕 LLM 后训练与多模态方向多年,从模型训练的一线工程师到战略层面的技术顾问,始终站在大模型浪潮的最前沿。坚信好的技术产品不是 PPT 里的指标,而是用户打开后能感受到的东西。

目前在 KAI 担任创始人特别顾问与独立董事,为平台在 AI 方向的技术布局提供战略级建议。此前专注于大规模语言模型的推理能力提升与多模态数据合成,主导过多个从零到一的研究项目。

写论文、跑实验、带团队、看方向——习惯在一线和战略之间随时切换。不说空话,只聊真实的技术判断。

5+
篇学术论文
含 ICLR / ICCV 顶会
3+ 年
LLM 一线研发
推理 & 多模态方向
150+
GitHub Stars
DocGenome 项目
SOTA
多项任务
StructEqTable / Chimera

经历

从模型训练的一线研究者到平台战略顾问。

2026 – 至今
创始人特别顾问 / 独立董事
KAI · kai.com
  • 为 KAI 交易平台在 AI 方向的技术路线与产品策略提供战略咨询
  • 参与 Web4 架构下 AI 与数字资产交易场景的融合方案设计
  • 协助团队评估大模型技术栈选型与落地可行性
AI Strategy Web4 Tech Advisory
2022.08 – 2026
LLM 研究员 · Reasoning & Post-training
LLM Research Lab
  • 主导 LLM 推理能力提升:基于 Qwen3-8B 通过 RLVR / SFT / verl / OPSD 将 AIME 2025 准确率从 55% 提升至 70%
  • 为 Qwen3-30B-A3B 实施 SFT + RLHF + RLVR,引入 Cascaded RL、Multi-task RL、Multi-teacher OPD 等训练策略
  • 基于 veRL 框架构建支持 MoE 的 RL Rollout / Training 基础设施及 Expert Routing RL
RLVR SFT RLHF MoE veRL
2022.08 – 2026
MLLM 研究员 · 数据合成与架构设计
LLM Research Lab
  • 主导 DocParser 项目,构建含 680 QA 对 & 多图像的 DocGenome 数据集(Table 20 万 / Equation 50 万 / Chart 2 万),GitHub 150+ Stars
  • 基于 DocGenome 开发 StructEqTable 与 Chimera 模型,达到 SOTA(Chimera 论文被 ICCV 2025 接收)
  • 针对 DeepSeek-VL 应用 CUR + IG 技术微调,达到 94% 准确率,成果发表于 ICLR 2026
MLLM DocGenome DeepSeek-VL ICCV 2025 ICLR 2026

论文发表

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
Y. Wang, S. Mao, et al.
ICLR 2026 项目负责人
Chimera: Improving Generalist Model with Domain-Specific Experts
Peng T, Li M, Yuan J, ..., S. Mao, et al.
ICCV 2025
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
R. Xia, S. Mao, et al.
arXiv:2406.11633 项目负责人 · GitHub 150+ ⭐
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
Li S, Shen Y, Chen X, ..., S. Mao, et al.
arXiv:2505.00063
IWR-Bench: Can LVLMs Reconstruct Interactive Webpage from a User Interaction Video?
Chen Y, Liu M, Shen Y, ..., S. Mao, et al.
ICLR 2026

技术能力

从训练框架到分布式策略,从模型架构到数据管线。

Training Frameworks
PyTorch FSDP DeepSpeed Megatron-LM FlashAttention veRL
训练方法
SFT RLHF RLVR PPO DPO GRPO OPD Cascaded RL Multi-task RL
分布式 & 基础设施
TP PP DP MoE Routing RL Rollout Infra
编程语言
Python C++ Linux GPU Programming

联系