计算机经历
AI 应用、科研工作流、机器学习与软件开发。
显示全部 9 项
C10:多 Agent 生物科研工作流系统
2025.08–2026.04UC Berkeley · Chris Anderson 合成生物实验室
AI / Agent生物信息软件工程
面向不擅长编程的合成生物研究者,将自然语言分析需求转化为工具检索、能力补全、验证执行和结果回传流程,降低跨工具科研任务的使用门槛。
工作与方法:C10:多 Agent 生物科研工作流系统
- 多源证据采集:负责 Scraper 子 Agent,整合 GitHub、PubMed/arXiv 与网页检索,将算法依据、代码、依赖和许可证信息收敛为结构化证据,供下游工具生成使用。
- 工作流可靠性:负责缺失工具恢复、Agent Eval 与测试状态隔离;在后续工程强化中将恢复链实现为 5 节点 LangGraph 状态机,最多生成 3 次,明确失败和完成终态。
- 检索与任务评测:参与工具检索评估与结果分析;团队在 1,127 个工具、3,321 条查询的受控评测中取得 Recall@1 86.3%、Recall@5 97.4%,平均检索延迟 39.3 ms,并识别非领域查询的误匹配问题。
- 回归与可追踪性:通过运行 Trace、结构化结果与文件/状态后置条件定位失败;以工具库快照和回滚隔离测试污染,测试 56 个非网络用例的两轮回归均通过。
- 工具复用:结合团队工具库复用机制分析端到端收益:15条工具类测试 Prompt 任务由首次生成链的平均 222.2 s 降至复用执行的平均 6.3 s,为重复科研任务减少工具准备开销。
Python、LangGraph、FastAPI、Pydantic、FAISS、BM25、PubMed、MCP、pytest、SSE
企业知识库 RAG 与 MCP 工具服务平台
2026.06–至今独立开发
AI / AgentRAG / 检索数据库
面向专业 PDF 的私有知识检索,将文档处理、混合召回、排序评估与带引用工具服务串联,支持 AI IDE / Agent 调用可追溯的知识结果。
工作与方法:企业知识库 RAG 与 MCP 工具服务平台
- 混合检索:实现 Dense + BM25 双路召回、RRF 融合和 Cross-Encoder 重排;记录各阶段候选、排序与耗时 Trace,支持检索坏例定位和策略迭代。
- 文档入库:构建 PDF 解析、Markdown 转换、语义分块、Metadata 增强、Embedding 与 Upsert 全链路;基于 NIST AI 治理文档/ BioASQ 广义生物医学与临床研究问答形成 8,000+ 个 Chroma Chunk。
- 数据质量:针对英文粘连与断词增加质量检测、规则修复和审计;测试文档中修复 468 处文本,粘连词串减少 61.1%,需人工复核的 Chunk 减少 19.9%。
- 隔离评测:基于 NIST AI / BioASQ 文档分别制作 40 条人工审阅/ 60 条官方专家标注的Golden Set。采用 Dev/Test 隔离与严格相关性标注;盲测 Hit Rate@5 分别达到 92.5% / 93.33%,与同一测试集基线相对提升 37.5% / 21.66%。
- 服务交付:通过 MCP stdio/JSON-RPC 暴露 query_knowledge_hub、list_collections、get_document_summary 等带引用工具,配套 Streamlit 控制台及 Ragas / 自定义评估入口。
Python、RAG、MCP、BM25、RRF、Cross-Encoder、ChromaDB、SQLite、Streamlit、Ragas
Expression2Translation:RNA-seq / Ribo-seq 联合分析工作流
2025.09–2025.11独立开发
生物信息软件工程数据库
针对酿酒酵母复制衰老的转录与翻译变化,将公开 RNA-seq / Ribo-seq 数据转化为可复查的质量指标、定量结果与翻译效率候选清单。
工作与方法:Expression2Translation:RNA-seq / Ribo-seq 联合分析工作流
- 工作流工程:以 Snakemake 编排 metadata、QC、RNA、Ribo 和 integration 五阶段,处理 8 个文库、12 个 FASTQ;通过 samplesheet/JSON Schema、统一参考与参数门禁约束输入,支持增量重跑。
- 转录组分析:使用 FastQC/fastp/MultiQC、Salmon、tximport 与 DESeq2 完成 RNA 分支;4 个 RNA 文库比对率 90.93%–94.71%,5,316 个基因进入差异分析,筛得 294 个 padj<0.05 的基因。
- 翻译组质控:针对高 rRNA 污染诊断读长、方向与 P-site,结合 riboWaltz 交叉校准选用 28 nt reads 和 12 nt offset;有效 CDS P-sites 的 frame-0 比例达到 80.12%–92.45%。
- 联合候选筛选:在 6,600 个共有编码基因中统一分析口径,结合计数支持、伪计数敏感性与 leave-one-library-out 检查,将 729 个计数支持候选进一步筛为 283 个方向稳定的描述性 TE 候选。
- 结果交付:构建 SQLite catalog 与 Markdown/HTML 报告,扩展项目 registry 和 CLI 管理隔离目录、状态与产物索引;分析完成后 dry-run 为 no-op,避免无关步骤重复计算。
Python、R、Snakemake、Conda、Salmon、DESeq2、Bowtie2、SAMtools、riboWaltz、SQLite、GitHub Actions
PSPNet 驱动的内镜息肉分割:多尺度特征聚合与标签标准化
2023.10–11独立项目
机器学习生物信息
基于 Kvasir-SEG 的 1,000 对胃肠镜图像构建息肉像素级分割流程,针对病灶区域的尺度变化与标签格式问题完成数据适配,实现可复现的息肉像素级训练和评估流程。
工作与方法:PSPNet 驱动的内镜息肉分割:多尺度特征聚合与标签标准化
- 数据适配:将 JPEG 掩码按阈值转换为 0/1 无损 PNG,检查图像与标签配对,并固定随机种子划分 800 张训练、200 张验证图像,使二分类标签与损失函数、评估口径一致。
- 实现训练流程:使用 PyTorch 实现 ResNet-50 主干与 PSPNet 金字塔池化模块,以 1/2/3/6 四种网格尺度聚合上下文;对图像和掩码进行同步几何增强,采用主分类头与辅助分类头的交叉熵损失训练。
- 训练评估:实施图像与标签同步增强、分组学习率及 poly 调度;修复后训练正常收敛,在验证集上取得 mIoU 83.52%、息肉前景 IoU 71.38%、Dice 79.07%。
- 实验归档:保存固定划分、训练曲线、checkpoint 与最终指标,联合报告前景 IoU、Dice 和像素准确率,便于区分病灶区域效果与背景像素占比带来的影响。
Python、PyTorch、ResNet-50、PSPNet、OpenCV、NumPy
Diversify:股票组合多样性分析
2023.09–2023.11独立开发
机器学习数据可视化
针对持仓数量难以反映真实属性分散程度的问题,融合公司文本与市场特征,以软聚类构建可解释的组合结构多样性评分。
工作与方法:Diversify:股票组合多样性分析
- 多源数据建模:汇集约 500 家 S&P 500 公司描述及市场指标,将 Word2Vec 文本表示与相对成交量、市值、P/E、波动率对齐为建模特征,处理主键、缺失值与尺度差异。
- 分布诊断:针对市值长尾导致样本聚集的问题采用对数变换;在 2–19 个 GMM 成分间结合 BIC、silhouette 与 PCA 可视化选择 5 成分模型,并保留层次聚类对照。
- 组合评分:按持仓金额汇总股票的聚类概率,与均匀暴露向量比较得到多样性评分;预设高/低多样性组合的 GMM 均分为 2.916/1.067,分离比约 2.73×,层次聚类约 1.05×。
Python、Pandas、Word2Vec、scikit-learn、GMM、层次聚类、PCA、Matplotlib
The Conqueror:iOS 教师资源与社群 App
2022.10–2023.04美国NGO Blessed Newbie · 后端开发实习
后端开发数据库
为面向基督教教师的资源与社群 App 开发数据库和后端接口,承担数据库主责、社群内容 API 与 iOS 联调。
工作与方法:The Conqueror:iOS 教师资源与社群 App
- 关系数据设计:以 MySQL 建模用户、帖子、评论、互动、公告及资源实体,维护包含 20 张表、33 个存储过程的数据层,通过主外键和过程调用组织关联读写。
- 社群接口:使用 Node.js / Express 实现发帖、评论、点赞/踩及公告接口,以 UUID 标识内容并调用存储过程完成持久化,支持分组论坛与用户中心的数据需求。
- 客户端协作:与 Swift / SwiftUI 成员协同对齐 URLSession、JSON 字段及 JWT 调用约定,推进论坛、公告和个人中心的数据链路连接,配合版本迭代修复接口问题。
JavaScript、Node.js、Express、MySQL、REST API、JWT、Swift/SwiftUI、Git
汽车数据交互式可视化
2023.03–2023.05课程项目
数据可视化
将汽车数据中的多维关系呈现为可交互散点图,支持用户切换变量、查看车型和观察分布变化。
工作与方法:汽车数据交互式可视化
- 交互图表:使用 D3.js 的 Enter / Update / Exit 模式组织散点元素,按用户选择更新属性、坐标轴和样式。
- 探索体验:通过事件监听显示车型提示,结合 transition 平滑呈现坐标和元素变化,帮助用户连续比较不同维度的数据关系。
JavaScript、D3.js、HTML、CSS、SVG
Restaurant Supply Express:无人机配送管理模拟系统
2022.09–2022.12课程项目
数据库软件工程
面向餐饮供应与模拟无人机配送业务,设计关系数据库与操作界面,将仓储、配送数据组织为可查询和可更新的信息系统。
工作与方法:Restaurant Supply Express:无人机配送管理模拟系统
- 业务建模:根据原始业务数据梳理实体关系并绘制 ERD,以 MySQL 实现关系表及多表视图,支持仓储和配送信息检索。
- 界面连接:使用 Python tkinter 构建数据库操作界面,将表单输入与数据查询、更新连接,支持模拟系统管理。
MySQL、SQL、ERD、Python、tkinter
Java 桌面小游戏合集:2048 / 24 点 / 贪吃蛇
2022.06–2022.08Georgia Tech · 电子游戏社团Workshop
软件工程
将经典小游戏的规则、状态更新与图形交互整合进统一桌面入口,实践事件驱动编程、表达式求值和跨 GUI 框架集成。
工作与方法:Java 桌面小游戏合集:2048 / 24 点 / 贪吃蛇
- 模块集成:使用 JavaFX 构建合集主页与 Scene 导航,通过 SwingNode 接入 Swing/AWT 2048,组织返回、全屏和退出等窗口交互。
- 规则与算法:用双栈和优先级矩阵实现 24 点表达式求值,并校验输入数字多重集与牌面一致;以二维棋盘和合并标记组织 2048 的移动规则。
- 实时交互:围绕贪吃蛇实现方向控制、定时移动、食物生成、增长计分和碰撞检测,将游戏状态与键盘事件、图形刷新及重开交互连接。
Java、JavaFX、Swing/AWT、SwingNode、事件监听、数据结构