AI 时代开发者入门路线(大模型 / Agent / 多模态)【总览】
这篇文章是给「普通开发者」用的,不是做科研。目标很明确:在 AI 时代,怎么一步步把 LLM + Agent 真正用到项目里,先能做出原型,再逐步深入。
一、整体思路:分阶段上手,而不是一下子学“全栈 AI”
你可以按这条主线来理解自己的学习路线:
- 第一阶段:核心能力 — 快速上手大模型和 Agent 系统
- 会用 API,能做问答、摘要、生成类工具。
- 知道怎么让模型“调用工具”,而不是只会聊天。
- 第二阶段:数据接入与中间层 — MVP Server / 数据中台
- 把外部数据(新闻、行情、业务数据)统一整理好,喂给模型用。
- 第三阶段:进阶能力 — 多模态 & 知识图谱
- 学会用向量检索、知识库、图数据库做更复杂的问答与分析。
- 第四阶段(后期可选):生成平台 & MLOps
- 把自己的 AI 服务做成真正上线可用的产品,有部署、监控、版本管理。
下面每个阶段我都拆成了单独文章,你可以按需跳转(均在本模块下):
- 第一阶段:大模型(LLM)入门与 Prompt 规划 →
/ai/llm-basics - 第一阶段进阶:Agent / 工具型 AI 规划(含 System Prompt / Function Calling / MCP 速记)→
/ai/agent-basics - 第二阶段:MVP Server / 数据中台规划 →
/ai/mvp-server - 第三阶段:多模态 & 知识图谱规划 →
/ai/multimodal-kg - 第四阶段(可选):部署 & MLOps 规划 →
/ai/mlops-platform
下面是压缩版总览,方便你先选阶段,再去看对应文章。
二、第一阶段:核心能力 — 大模型(LLM)与 Agent 入门
1️⃣ 大模型(LLM):先学会“调用”和“提示”
阶段目标:
- 知道 LLM 是什么,有哪些主流模型(GPT、通义千问、LLaMA 等)。
- 能通过 API 调用模型,实现:问答、摘要、生成文案/代码。
- 会写基本的 Prompt,让模型输出更符合预期。
建议学习内容:
- 基础了解:
- 什么是 LLM / GPT / Qwen / LLaMA,大致能力和区别。
- 看一眼 OpenAI / 通义 / Moonshot 等官方 API 文档,知道请求/响应长什么样。
- 调用练手:
- 用 Python 或 JavaScript 写几个小脚本:
- 给一段新闻,让模型输出三句话摘要。
- 给一段产品说明,让模型写面试自我介绍或卖点总结。
- 用 Python 或 JavaScript 写几个小脚本:
- Prompt 设计基础:
- 几个核心概念:Zero-shot / Few-shot / Chain-of-Thought(思维链)。
- 练习:给模型「角色 + 目标 + 输入格式 + 输出格式」;试比较不同 Prompt 的效果。
推荐工具:
- OpenAI Playground、阿里通义的在线控制台。
- Hugging Face Hub(看看有哪些开源模型)。
- 官方 API 文档(多翻几遍,比网文更靠谱)。
练手小项目建议:
- 新闻摘要生成器
- 输入:一段新闻或一篇博客链接(简单可以先手动复制粘贴)。
- 输出:3 点摘要 + 一段“普通人能听懂的解释”。
- 简单问答机器人
- 做一个命令行或网页,前端一个输入框,后端调用 LLM 接口返回结果。
这一阶段的关键是:先把“会用 API”变成肌肉记忆,不要一上来就研究模型结构和论文。
2️⃣ Agent / 工具型 AI:让模型“能干活”
阶段目标:
- 理解什么是 Agent:模型 + 工具 + 任务规划。
- 学会用一个简单框架(比如 LangChain),让模型调用外部接口完成任务。
建议学习内容:
- 了解常见框架:
- LangChain(Python/TS)、AutoGPT、OpenAI 的 function calling / tools 等。
- 简单工具调用练手:
- 选一个简单工具 API:如天气 API、股票行情 API、汇率 API。
- 让模型根据用户指令:
- 解析出需要调用哪个工具、需要什么参数。
- 调用 API 拿到数据。
- 用自然语言解释结果(比如:是否适合出门?股票是否波动很大?)。
- 多步骤任务(Task Planning):
- 理解“让模型自己拆步骤”的概念:分析需求 → 规划步骤 → 逐步执行。
练手小项目建议:
- 投资小助手(简版)
- 输入:股票代码或币种。
- Agent 流程:
- 调用行情 API 获取当前价格/涨跌。
- 调用新闻 API 获取近期相关新闻。
- 让模型输出一段“风险提示 + 中立分析”(而不是直接给买卖建议)。
- 自动化日程提醒
- 把日历/待办(可以先用本地 JSON 模拟)作为数据源。
- AI 接收自然语言指令(比如“帮我看看这周哪天有空学习 3 小时”),给出整理后的建议。
三、第二阶段:数据接入与中间层 — MVP Server / 数据中台
3️⃣ MVP Server:让模型“吃到干净的数据”
阶段目标:
- 能写一个简单的中间层服务:把多种数据源(新闻、行情、数据库)整理成统一格式。
- 模型只需要调用你这个服务,就能拿到“结构化、干净的上下文数据”。
建议学习内容:
- API 设计基础:
- REST 基本规范、常见状态码、简单的接口风格。
- 有余力可以看一下 GraphQL 的基本概念(非必须)。
- 数据清洗与标准化:
- 从 JSON / CSV / 数据库表中读取数据。
- 做字段统一:例如都整理成
{ time, source, title, content, tag }这种格式。
- 中间层实践:
- 写一个小服务(Python FastAPI / Node.js / Spring Boot 均可):
- 定时爬取或拉取新闻、行情数据。
- 存入本地数据库或缓存。
- 对外提供一个统一的
/ai/context接口,返回整理好的数据列表。
- 写一个小服务(Python FastAPI / Node.js / Spring Boot 均可):
练手小项目建议:
- 新闻 + 股票行情抓取服务(MVP)
- 任务:
- 写一个脚本或服务:
- 定时拉取新闻接口。
- 定时拉取某几个标的的价格。
- 暴露一个接口:
/context?symbol=xxx,返回该标的最近 N 条新闻 + 价格走势。
- 写一个脚本或服务:
- 后续:让你的 LLM/Agent 优先调用这个中间层接口,再基于返回的数据做分析。
- 任务:
这一阶段的思路是:别一上来就让模型去“满世界乱抓数据”,先自己搭一个小数据中台,再让模型来消费。
四、第三阶段:多模态 & 知识图谱 — 做更聪明的 AI 助手
4️⃣ 多模态 / 知识图谱:让检索和推理更“聪明”
阶段目标:
- 掌握向量检索(RAG)的基本概念,能自己搭一个简单的“私有知识库问答系统”。
- 了解图数据库(如 Neo4j)的基本使用,知道什么时候需要图结构而不是平铺的表。
建议学习内容:
- 向量检索基础(RAG):
- Embedding(文本向量化)的概念:把文本变成向量,方便相似度搜索.
- 向量数据库:Milvus、Weaviate、Pinecone 等,至少会用其中一个。
- 多模态应用:
- 文本 + 图片:比如根据一张图和一段描述,做联合检索或问答。
- 文档问答:PDF/Markdown/网页内容切块,向量化后做检索。
- 知识图谱 / 图数据库:
- Neo4j 基础:节点(Node)、关系(Relationship)、属性(Property)。
- 知道什么时候用图结构更适合:复杂关系、路径查询、推荐关系等。
练手小项目建议:
- 投资分析知识库(RAG + 简单图)
- 把历史新闻、公告、公司信息等整理成一个文档集合。
- 使用向量数据库搭一个“问答机器人”:
- 例如问:“这家公司最近三个月有哪些利空消息?”
- 可选进阶:用 Neo4j 把“公司—高管—事件—行业”之间的关系建成图,用来查询“关联风险”。
- 企业内部问答系统(简化版)
- 把自己写的学习笔记、规范文档(比如你这个面试笔记库)做成一个知识库。
- 做一个 Web 页面:输入问题 → 检索相关文档片段 → 让模型基于这些上下文回答。
五、第四阶段(可选):生成平台 & MLOps
5️⃣ 部署与运维:从“玩具 DEMO”走向可用产品
这一阶段可以在你前面几步都比较熟练之后再考虑,属于“做产品和平台”的能力。
阶段目标:
- 能把自己的 AI 服务部署到线上(本地服务器或云端)。
- 知道基本的日志、监控、版本管理,避免“改一版就把线上搞挂”。
建议学习内容:
- Docker 基础,能给自己的服务写一个简单的
Dockerfile。 - CI/CD 基础概念(例如 GitHub Actions、Jenkins),知道怎么自动构建和部署。
- 基本监控:
- 接口 QPS、错误率、响应时间。
- 模型调用次数、失败率、延迟。
练手小项目建议:
- 把你的“面试学习 Agent / 投资助手”做成一个简单 Web 服务:
- 提供 HTTP 接口或一个基础 Web 页面。
- 用 Docker 打包,部署到一台云服务器。
- 加上基础日志记录,方便出问题时排查。
六、和你当前学习/求职主线的关系
- 这条 AI 路线是围绕你现有的 Java 面试笔记库 + 远程工作目标 设计的:
- 阶段一:让 LLM 变成你的“高效助理”;
- 阶段二:让你的笔记和业务数据结构化,喂给模型吃;
- 阶段三:用 RAG/图谱做更聪明的知识助手;
- 阶段四:把这些能力真正部署出来,形成可以讲的项目经历。
当你能自然地对面试官说:“我有一套自己的面试学习 Agent / 知识库助手,从数据整理到部署上线都是我自己搭的”,这条路线的价值就完全体现出来了。