自动驾驶 中间件与 SIL 仿真框架 工程师,正在向 AI Infra 延伸。
从零主导 MFF 多域并行状态机仿真框架(3 域并行 · 190+ 状态节点 / 95%+ 状态覆盖),
手写无锁通信总线与 C++20 协程调度底座,并独立实现了 LLM 推理调度器与训练并行调度内核。
主线是 C++ 高性能编程与车载系统,近半年延伸到 LLM 系统方向 —— 两条线共用同一套"先量化、再优化"的方法论。
精通 Modern C++(11/14/17/20),熟练模板元编程、可变参数模板、RAII 与智能指针; 深入 C++20 协程、无锁并发(无锁队列、seqlock、原子操作、内存屏障)、动态内存池与零拷贝优化。
从零自研轻量级高性能自动驾驶中间件;熟悉 Pub/Sub 消息总线设计、 多模式任务调度器(优先级轮询 / Choreo 数据流触发)、IPC 共享内存与跨机 TCP 通信; 深入理解车载数据链路、QoS 策略与全链路可观测性。
熟悉规控与感知核心算法(EKF 多源融合、ST 图 DP 规划、Piecewise-Jerk 带状 QP、LTV MPC 轨迹跟踪); 熟练搭建 MFF 多域并行状态机 SIL/HIL 仿真闭环框架、并发仿真引擎与场景评估系统; 掌握状态机静态分析、迁移追踪、守卫覆盖与不变式验证。
独立实现 LLM 推理调度内核(Paged KV / 连续批处理 / 前缀缓存 / DeepSeek MLA / 投机解码) 与 训练并行调度内核(DP / 张量并行 / 流水线并行 / 异步 1F1B)。 CUDA 侧手写 PTX GEMM kernel,用 位级对账(bit-parity)验证并行策略的正确性。
从集成调优到平台研发,做的一直是"让系统在真实约束下跑得对且跑得快"。
六个仓库,一条主线:把性能约束变成可复现、可对账的实测数字。近期的两个 LLM 系统项目正在把这条线延伸到 AI Infra。
LLM 推理调度器 —— 从零手写 vLLM 的核心调度机制:分块 KV 管理、连续批处理、前缀缓存、DeepSeek MLA 潜空间压缩与投机解码。挂在 flowcoro 旁边的独立推理仓,不改动 flowcoro 本身。
BlockManager(分块 KV 管理)/ Scheduler(连续批处理)/ Engine(引擎主循环),外加 nn::{RoPE, MLA, Speculative} 算子层。chat_cli 逐字流式生成 + Web 对话界面,非静态 demo。| 配置 | peak KV 块 | TTFT (μs) | TPOT (μs) |
|---|---|---|---|
| full(paged+cont+prefix) | 24 | 16728 | 323 |
| no_paged(预留 max_len) | 48 | 16728 | 323 |
| + mla_latent_kv | 8 | 16728 | 323 |
| + speculative_decoding | 25 | 5745 | 112 |
| + modern_stack (mla+spec) | 8 | 5745 | 112 |
8,显存占块降至原来的 1/3。65.6%,TPOT 323μs → 112μs,生成提速近 3 倍。分布式训练并行调度内核 —— 从零手写 DP / 张量并行 / 流水线并行三套并行策略,把「与单进程参考逐 bit 全等」当作唯一的正确性验收线。
BoundedChannel(容量 2)做流量控制与反压,通道满/空走 co_await flowcoro::yield() 协程级让出,消灭线程自旋。mul.rn.f32 + add.rn.f32 分步舍入规避 FMA 单次舍入漂移,输出与 CPU 参考逐 bit 全等。require_gpu=true 禁止静默降级到 CPU;用硬件发射计数核准(gpu_launches=64/64)证明真在 GPU 核上跑了。CudaStream + Pinned DMA 往返,解除全局互斥锁。10 vs 32;同时诚实标注 —— Tf=Tb 且 M 不大时不保证 1F1B makespan 更短(span 236 vs 226)。仿真优先的自动驾驶中间件与 ADAS 算法闭环平台。从零独立研发,包含无锁通信总线、协程调度、多传感器融合、轨迹规划与控制全流程。
P50 152ns / P99 179ns。面向车载高并发交互与资源受限场景自研的现代 C++20 协程库与并发调度框架。已作为 KunAutoDrive 车规管线与 FlowTrain 异步流水线的调度底座。
| 场景 | 方案 | 吞吐 | 平均延迟 |
|---|---|---|---|
| 阻塞 IO · 2000 请求 | 线程池 | 7,220 RPS | 138.5 μs |
| 阻塞 IO · 2000 请求 | FlowCoro 协程 | 285,714 RPS | 3.5 μs |
| 高并发 · 10 万请求 | thread-per-request | 31,655 RPS | 34.9 MB 内存 |
| 高并发 · 10 万请求 | FlowCoro 协程 | 16,666,667 RPS | 11.5 MB 内存 |
105 ns。软件定义硅基细胞计算机(SDSCC)—— 一次偏执的跨领域实验:把图灵形态发生、Kahn 拓扑编译与 NEAT 拓扑演化,塞进一个纯 C11、零 GC 的可计算皮层。FlowServe 的 MLA 与投机解码正是移植自这里。
19.06 ns。大一起自主系统修读计算机专业核心课程:操作系统、计算机网络、数据结构与算法、编译原理等,具备扎实的底层计算机系统功底与编程能力。
对自动驾驶工具链、C++ 高性能编程、LLM 推理与训练系统有兴趣 —— 随时找我。