Building deployable AI systems for real-world engineering scenarios.
面向真实工程场景,构建可部署、可审计、可扩展的智能体与多模态 AI 系统。
我是 YuXuanLin,人工智能方向硕士研究生,长期关注 行业智能体、计算机视觉、多模态推理、大模型私有化部署与生成式 AI。
我更关注“把模型做成系统”而不是只停留在单模型 Demo:从感知、证据聚合、规则推理与 RAG,到 Agent 编排、工具调用、人工复核、报告/台账与本地部署,形成可以持续迭代的完整闭环。
Current focus: Engineering Agents · Multimodal Reasoning · Local AI Infrastructure · AI Film / Short Drama
|
面向施工现场与低空无人机巡检的多模态安全智能体。将 影像接入 → 目标/场景识别 → 结构化证据 → 风险研判 → 安全知识检索 → 整改台账 编排为可追踪闭环。 Highlights
|
|
面向供水管网分析与运维辅助的公开示例 Agent。围绕 管网拓扑、运行时序、风险关系、证据约束分析与可视化 构建可复现流水线,并提供 CLI / Python API / HTML Dashboard / Open WebUI 适配。 Highlights
|
|
面向 写实 AI 电影 / 短剧 / 商业视频 的本地生产流水线。以 ComfyUI 为编排层,整合 MiniMax-H3、Qwen、角色一致性与关键帧工作流,覆盖从创意到镜头生成的完整链路。 Highlights
|
|
高空热成像小目标人员检测。基于改进 YOLO,引入 |
煤块 / 矸石智能识别与端到端应用,集成改进 YOLO、Gradio 可视化、语音播报与串口联动。 |
视觉 + 音频多模态宠物行为分析,覆盖行为识别、声音理解、风险提示与饲养建议。 |
🌉 Bridge Inspection Agent — 城市路桥隧边坡结构病害识别、描述生成、知识检索与分级评定,当前持续开发中。
| Layer | Focus |
|---|---|
| Perception | Object Detection · Small Object Detection · UAV Vision · Multimodal Perception |
| Reasoning | VLM · Evidence Aggregation · Spatial / Rule Reasoning · RAG |
| Agent | Tool Calling · Workflow Orchestration · Memory · Trace · Human Review |
| Generation | ComfyUI · T2V / I2V / R2V · Character Consistency · AI Film Pipeline |
| Infrastructure | Local LLM / VLM · SGLang · OpenAI-compatible API · Linux · Docker · PPU |
| Delivery | CLI · Python API · Web UI · Dashboard · Report / Ledger · Commercial Integration |
- Local-first when data is sensitive — 对工程私有数据优先采用本地推理与受控存储。
- Evidence before conclusion — 重要结论尽量保留来源、结构化证据与可审计 trace。
- Model-agnostic architecture — Agent、工具协议与模型服务解耦,允许替换 detector / VLM / LLM。
- Human-in-the-loop for high-stakes outputs — 安全、运维与生产决策保留人工确认边界。
- Reproducible engineering — 用版本、配置、测试、日志和明确的数据边界保证可复现性。
公开仓库主要用于展示 Agent 架构、工程实现、工作流、接口与可复现示例。
模型权重、真实工程数据、现场媒体、私有知识库、密钥与生产部署配置不会随公开仓库分发。各项目的开源 / 商用边界以对应仓库的 LICENSE 与说明文件为准。
