构建和部署AI应用必须啃下这六块硬骨头

2026-08-22 21:25:15 · chineseheadlinenews.com · 来源: AI寒武纪

吴恩达深度拆解AI工程师核心能力:从LLM底层原理、数狙坦养、智能体搭建,到评估驱动开发、生产环境运维,再到机器学习基础,六块硬骨头环环相扣。其中最关键的一条——能跑通严格评估闭环,才是优秀与普通工程师的真正分水岭。

吴恩达老师刚刚发了一篇文章,专门拆解AI工程师的核心能力。

他研究了大量招聘信息,做了系统的专家访谈和问卷调查,最终把“会做AI应用”这件事拆成了6块。

这6块能力分别是:LLM基础、用数据给模型打地基、搭建智能体系统、以评估驱动开发、生产环境运维,以及机器学习基础。

听起来像是目录,但每一块展开,都有东西。

AI应用和普通软件,差在哪?

先说一个根本性的差异。

传统软件,输入确定,输出确定。你写一个排序函数,跑一万次结果都一样。

AI应用不是这样的。LLM会输出什么,你事先不知道。模型会犯什么错,你也不知道。这种不确定性,让整个开发过程必须反复迭代——写一版,看看效果,再决定下一步怎么改。

所以AI工程师的核心能力,本质上是在不确定中做决策的能力。

第一块:搞懂LLM的底层

很多人用LLM,就像用一个黑箱,扔进去一个问题,等答案出来,然后不知道为什么它答对了,也不知道为什么它答错了。

吴恩达认为,这不够。

你要理解LLM怎么把文本切成token,怎么逐步生成输出。这样你才能判断:这个任务它能干好吗?在什么情况下它容易出错?

除此之外,还有一堆工程细节需要掌握:什么时候用多模态模型,怎么在有限的上下文窗口里做取舍,缓存怎么算,模型的知识截止到哪里,推理的算力怎么控制,工具调用什么时候用。

再往深走,还有一个问题:什么时候需要微调模型,什么时候考虑自己部署。

这些事,理解了底层才能做出对的判断。

第二块:给模型喂对数据

LLM的输出质量,很大程度取决于它的输入。

早期流行的做法是RAG,用向量搜索把相关内容塞进上下文里。但现在,这套玩法已经远不止于此。

你需要判断:哪些内容应该直接写进prompt,哪些让模型在用的时候自己用工具去查?

数据的组织方式怎么选?向量索引、知识图谱、结构化数据上的语义层,各自适合什么场景?

文档要怎么处理才能让模型读得懂,PDF、HTML、图片,不同格式的处理方式不一样。

还有一件容易被忽视的事:数据的质量要持续维护,不能一次性处理完就不管了。

第三块:搭智能体,有讲究

智能体系统的形态,差异很大。

简单的是固定工作流:预先设计好一系列LLM调用步骤,一步接一步执行。复杂的是让LLM自己判断下一步,循环决策直到任务完成。

怎么选?吴恩达给了几个判断维度:

哪些步骤可以并行跑,哪些必须串行?什么地方用代码更可靠,什么地方用LLM更灵活?出错了怎么回退?

工具调用方面,模型能用哪些工具、能执行什么命令,都需要设计。记忆怎么管理——特别是会话很长的时候,上下文放不下,怎么办?什么时候需要多个智能体协作而不是一个智能体搞定所有事?

还有一件很重要的事,往往被跳过:原型跑通了,怎么让它变成可以放进生产环境的可靠系统?这需要考虑安全边界、对抗性输入,以及防止数据泄露之类的风险。

第四块:用评估驱动开发,这是真正的分水岭

这一块,吴恩达说:

在他见过的AI工程师里,能够跑通一套严格的评估闭环,是区分优秀和普通的最关键特质。

什么意思?

很多人改系统靠感觉,觉得哪里不对就改哪里,改完凭主观判断“好像好了一点”。

厉害的工程师是另一种做法:先把要衡量什么想清楚,再建立一套评估机制,每次改动之后跑评估,根据数据决定下一步改什么。

评估本身也是技术活。你要分析系统的输出和中间过程,结合业务目标确定衡量指标。评估的形式也有很多:代码写死的规则、用LLM来打分、让人来判断。这三种各自适合什么场景,本身就需要判断力。

而且评估也不是一次性的,它要跟着系统迭代一起演进。

第五块:生产环境,另一个世界

把系统做出来是一回事,在生产环境里跑起来是另一回事。

AI应用的运维,和传统软件的运维有几个关键差异。

第一是观测。你需要知道系统在真实用户身上的表现,而不只是测试集上的表现。性能要监控,数据分布的漂移要发现,模型突然变差或者被攻击注入,要能快速响应。

第二是测试体系。AI系统的回归测试,比传统软件复杂——很多结果没有唯一正确答案,需要统计方法来判断是不是变好或者变差了。测试的力度,要和出错的代价匹配。

第三是成本和延迟控制。选哪个模型、要不要蒸馏、工作流能不能简化,这些决策在用户量上来之后,会直接影响系统能不能活下去。

第六块:机器学习基础,绕不开

最后一块,吴恩达说:

他认识的所有在LLM应用上做得好的工程师,都对机器学习和深度学习有一定深度的理解。

为什么?

因为LLM本身就是机器学习的产物,很多判断需要从ML的视角才能做对。而且很多实际应用场景里,还是需要用到传统的机器学习——无论是用别人训练好的模型,还是自己训练。

更重要的是,机器学习里有几个核心概念,对做AI应用极其有用:偏差方差的权衡、错误分析、数据工程。这些概念提供了一套思维框架,帮你在面对不确定输出的系统时,做出更好的判断。


    24小时新闻排行榜更多>>
  1. 00后向劣祖劣宗开炮:年轻人不相信承诺
  2. 亚朵卖“枕头被子”收入逼近酒店主业
  3. 俄联邦安全局退役少将在家中身亡,疑似自杀
  4. 人形机器人运动会:百米9秒39
  5. 西班牙“狼孩”去世
  6. 曝光林肯号航母内幕的美国军报多人被解雇
  7. “深海巨兽”创美东纪录 麻州捕获571.5公斤蓝马林鱼
  8. 川普谈美债:终极干预手段是美军,如果需要.....
  9. 执教哈佛第一人 顶戴花翎足蹬皂靴的中国老师
  10. 恒生科技指数拟扩至50只
  11. 许家印案子3人怎偿债? 恒大“2.4兆人民币黑洞”追赃
  12. 读4年大学恐多背$1.5万债务
  13. 继12337后 习近平又被实名举报到12339平台
  14. 印度6岁男童被老师掌掴后身亡
  15. 德国银行突然接入人民币,是欧洲根本没得选
  16. “越权且不负责任”,俄美共同批评联大主席贝尔伯克
  17. 这是一次堪称屈辱的退让
  18. 体面养老躺平 全球各国到底哪里最便宜 哪里最贵?
  19. 两任军委科技委一把手被除名 知情人爆军工腐败黑幕
  20. 【名篇赏析】读名句 懂人生
  21. 个税新规落地!潘石屹300亿离岸信托遭清算
  22. 前员工谈许家印:远看厉害 近看抽象 很爱演
  23. 美加贸易谈判破裂
  24. 6年后,哈里王子的美国梦碎了
  25. 四川马边县极端强降雨引发山洪
  26. CIA爆罕见离职潮!退休金竟要等9个月 恐酿风险
  27. 营救敏辛成美国优先事项 中方称不存在任意拘押
  28. 揭开东北解放的真实面纱 1945年苏军干了什么?
  29. 隐形门把手有安全隐患,特斯拉大规模汽车召回
  30. 贝森特“工具箱”难敌油价与消费疲软双重夹击
  31. 张丹丹教授能不能主动去享受一下灵活就业的“福利”?
  32. 从军费首破万亿到川习会议程:台湾连连成为焦点
  33. 热浪侵袭欧洲:超额死亡逾3万人
  34. 中国启动最大规模汽车召回
  35. 美加谈判破裂,加拿大酝酿反制
  36. 太意外,越南和印度也开始催生了?
  37. 众星现身那英演唱会,王菲到场
  38. 台海在本周已多次成为舆论焦点
  39. 人工智能如何影响中国人对爱情和永生的追寻?
  40. 日本跨党派议员代表团访华
  41. 驻日美军士兵疑手握枪支 头部流血死在车内驾驶位
  42. 西班牙“狼孩”去世 被狼群抚养12年 曾说人类最可怕
  43. DeepSeek的多模态模型,憋了这么久终于来了
  44. 曾创11秒最快KO纪录!38岁世界拳王家门口遭枪杀
  45. 顶级超模被雪藏25年 长期遭下药侵犯 送精神病院
  46. 蒙古网红带队闯中企营地,图什么?
  47. 韦东奕卖书爆火,亲属账号也上架
  48. 又一家!美企放弃美国模型,转用中国的Kimi K3
  49. “超级明星学者”辞职9天后身亡 学术问题变种族争议
  50. 习近平访美前夕 美国民间致信白宫声援母犬旺旺
  51. 中国拟修网管规定 吴钊燮示警恐成跨国镇压新工具
  52. 世界杯决赛斗殴处罚结果公布 阿根廷队4人受罚
  53. 多重冲击之下,百度不知道如何做搜索了
  54. 中纪委全会出席人数降最低 军方缺席13人 未见张升民
  55. 高清110幅,看遍吴冠中
  56. 内心强大的人 都锻炼过这3种能力
  57. 她白手起家赚800亿,却被许家印拉下水
  58. 京都大学学霸玩抽象,无人能敌
  59. 浙江金融帮窝案可能影响李强的去留
  60. 川普暂停乌拉圭等75国移民签证:违法