AI 工程能力提升平台
导入真实代码项目后形成成长闭环:代码扫描 → 12 维度 AI 工程审计 → 改进任务 → Git 代码评审 → 模拟面试 → 能力画像。评分由确定性引擎计算,LLM 只负责找问题。
角色 独立开发(产品设计 / 架构 / 后端 / 前端 / 安全 / 测试 / 部署)
面向计算机专业学生、实习生与初级开发者的 AI 工程能力提升平台。导入真实代码项目后,平台形成完整成长闭环:代码导入与扫描 → 12 维度 AI 工程审计 → 改进任务闭环 → Git 代码评审 → 模拟面试 → 能力画像与训练计划。
后端严格分层(API / Service / Repository / Model / Core),长任务走 Job 表 + 线程 Worker,前端为 Next.js 14 的完整工作台,并用 Docker Compose 一键部署。
学生和初级开发者写过不少代码,但缺少「工程视角」的反馈:不清楚自己的项目在架构、安全、测试、DevOps 上处于什么水平,也不知道下一步该练什么。
通用 AI 问答给出的评价不可复现、落不到具体代码行,面试准备也缺少基于真实项目的追问。
平台自身同样面临典型工程难题:LLM 输出不可信、长任务耗时、多用户数据隔离与安全边界。
把「代码能力提升」做成可执行闭环,而不是一次性评分:发现问题 → 生成任务 → 改代码 → AI 评审 → 能力画像发生变化。
评分必须可审计:总分由确定性评分引擎计算,LLM 只作为「找问题」的结构化抽取器。
工程可交付:分层后端、异步长任务、测试与 CI、Docker 一键部署、安全加固、真实 LLM 链路验证。
审计结果拆成两层:LLM 只输出结构化 Finding(问题 + 位置 + 依据),总分由评分引擎按维度权重确定性计算,避免同一份代码多次审计分数漂移。
导入、审计、任务生成、代码评审这些耗时环节统一走 Job 表 + 线程 Worker,配合 request_id / job_id 双追踪,前端轮询状态,失败可查。
能力画像不靠模型打分,而是由审计、任务、Review、面试产生的真实记录汇聚而成,因此「改代码 → 完成任务 → 面试」之后分数变化可复现。
前端 Next.js(Dashboard / Projects / Tasks / Git / Review / Interview / Skills / Learning)→ HTTP/JSON(/api/v1)→ FastAPI 后端严格分层:API 层(路由 / 鉴权 / 限流 / 参数校验)、Service 层(auth / audit / task / interview / skill / review / demo)、Repository 层(越权统一返回 404)→ Model 层(SQLAlchemy ORM,16 张表);Core 层包含配置、日志、LLM Provider、Prompt 边界、评分引擎、Git Service 与代码扫描器;线程 Worker 处理 import / analyze / generate_tasks / review_task;数据层为 PostgreSQL 16 + Redis 7 + 代码快照存储。
12 维度总分由代码加权计算,LLM 只产出结构化 Finding,规则可审计、结果可复现,不信任 LLM 自报分数。
数据库 Job 表 + 线程 Worker + request_id / job_id 双追踪,避免请求阻塞且失败可查。
并用真实 Git 仓库验证「高危问题检出 → 修复 → 复检为 0」的闭环。
DeepSeek / OpenAI / mock 三种实现同一接口,测试与演示零成本,真实链路走同一套代码路径。
分数来自审计 / 任务 / Review / 面试的真实记录,实测「改代码 → 完成任务 → 面试」后画像分数可复现变化。
Prompt 注入边界、生产环境弱 JWT_SECRET 拒绝启动、Git 参数白名单防命令注入、ZIP 路径穿越 / 炸弹校验、登录注册限流。
评分来源
选了 确定性评分引擎 + LLM 结构化 Finding,而不是 让 LLM 直接给出总分 —— 模型自评分数会漂移且无法解释,工程审计结论必须可复现。
代价:需要自己维护维度权重与评分规则。
任务执行方式
选了 Job 表 + 线程 Worker + 前端轮询,而不是 在请求内同步执行长任务 —— 接口需要快速返回,任务状态需要持久化与可追踪。
代价:需要自己承担任务状态管理,长任务仍在单进程内执行。
数据库兼容策略
选了 PostgreSQL / SQLite 同构支持并允许降级,而不是 只支持 PostgreSQL —— 本机环境受限,CI 与本地开发需要能完整跑回归。
代价:需要处理方言差异并维护迁移兼容性。
测试:后端 pytest 186 用例、前端 vitest 13 用例通过、typecheck / lint / build 通过;CI 覆盖 lint + test + build。
端到端实测(mock provider,走真实代码路径):注册 → 导入并扫描 132 个文件 → AI 审计 65.5 分(12 维度)→ 12 条 Finding → 12 个改进任务 → 完成 1 个任务 + AI Review(pass) → 模拟面试 90.8 分 → 能力画像 64.6 分(证据链完整)。
真实 LLM 冒烟(DeepSeek):对 Demo 项目完成真实审计,评分 33.8、12 维度 19 条真实 Finding(例如「API 层直接包含业务逻辑和 SQL 查询」「空 except 吞异常」)。
真实 Git 仓库验证:引入硬编码密码 + SQL 字符串拼接 → Review 报出 2 个高危 → 修复后复检 0 问题。
交付:Docker Compose(PostgreSQL + Redis + 前后端)一键部署、Demo 模式零上传体验、部署与验收文档齐备。
线上部署:https://codepilot.myiskg.com/ (腾讯云 Docker Compose 一键部署,支持 Demo 模式零上传体验;线上需注册账号后使用,登录页与注册页均已实测截图)。2026-09-24 起启用 HTTPS,同时把前端写死的 http API 基址改为同源相对路径,避免浏览器按混合内容拦截。
诚实边界(面试如实说明):本机 PostgreSQL 受安全软件限制,全量回归在 SQLite 上完成;限流为进程内实现,多实例需换 Redis 集中限流;演示视频待补。
不能让模型给自己打分:把「找问题」和「算分数」拆开后,结果才可复现,也更敢用在需要解释的场景里。
不可信输入要显式划定边界:用户代码进入 Prompt 时,权限与指令边界必须写进系统约束并用测试守住。
环境限制要如实记录:把「回归在 SQLite 上完成」「限流是进程内实现」写进结果,比含糊带过更可信。





