记录项目背后的过程:从 0 到 1 的架构、AI / Agent 开发、工程实践与项目复盘。作品集回答「我做过什么」,这里写清「我是怎么做的、为什么这么做」。
韦坤计算机科学本科生 · 后端开发 / AI 应用开发方向
最新文章,共 7 篇
忠实度只有 0.25,与人工观察明显不符。这是一次把嫌疑人先放在评测口径上的排查复盘:引用预览被截断污染了判分上下文,以及为什么我坚持给 RAG 项目先建可信的评测,再谈优化。
阅读全文
从分阶段实施到全项目回归检查:Agent 可以承担越来越多的执行工作,但「Agent 说完成了」不能自动等于「工程结果已经完成」。记录我如何把它的执行结果变成可验证的工程结果。
阅读全文
同一份代码多次审计分数会变,所以我把「找问题」和「算分数」拆开:LLM 只输出结构化 Finding,总分由确定性评分引擎按维度权重计算,并给不可信输入划出明确边界。
阅读全文
借书锁父表、还书锁子表会形成循环等待,高并发抢热门教材时连接池被打爆并出现负库存超借。记录我为什么选择统一加锁顺序而不是乐观锁,以及三个并发硬断言如何让结论可验证、可回归。
阅读全文
上传接口返回 200、容器内直连对象存储也返回 200,只有从边缘入口访问图片是 404。记录我用二分法把范围压到反代层、最终定位到 nginx location 匹配顺序的排查过程。
阅读全文
一个真实的跨主题漏检:为什么语义近邻不等于答案就在附近,以及我最终为什么选择自研 BM25 + 向量加权融合 + Rerank,代价是什么、边界在哪里。
阅读全文
WebRunner 里最难查的一个缺陷:观察层读的是 HTML 初始属性,动作改的却是运行时状态,于是模型永远看不到「已经填过」。以及它如何变成一条写进设计里的约束。
阅读全文
文章里提到的项目都在这里,可以点进项目详情看架构、取舍与实测结果。
导入真实代码项目后形成成长闭环:代码扫描 → 12 维度 AI 工程审计 → 改进任务 → Git 代码评审 → 模拟面试 → 能力画像。评分由确定性引擎计算,LLM 只负责找问题。
面向高校图书馆的全栈借阅平台:用确定性锁顺序消除并发死锁、用 FIFO 闭环状态机管理孤本预约、用库存感知的多路加权做推荐,后端 248 + 前端 96 用例,含 3 个并发硬断言。
面向高校的二手交易平台:校园身份认证(邮箱 / 学号双通道)作为发布硬前置,注册到评价的完整交易闭环与 100 分初始信用档案,单端口边缘网关交付,线上 40+ 接口 / 60+ 断言验收。
上传文档即可问答的 RAG 平台:标题感知分块 + BM25/向量混合检索 + Rerank + SSE 流式回答,自带 52 题评测体系与 Agent 工具调用。
用一句自然语言描述目标,Agent 自主操控真实浏览器完成:把页面提炼成紧凑文本快照喂给模型,模型每步返回一个原子动作,错误作为反馈进入下一轮。