前几天我在另一个工作区搭了一个电商内容智能体,取名叫”1电商”。搭完之后陆续有人问我:这东西到底是怎么搭起来的,能不能照着做一个。
我写了两篇相关的文章,一篇记流水,一篇讲我踩的一个认知坑。但这两篇都不是”教程”,看完你还是不知道该先做什么、后做什么。
所以这篇我换个写法,不讲我的感想,只讲顺序。你想自己搭一个能出标题、能出主图、能出详情页的电商智能体,按下面四步走就行了。
动手之前,先想清楚一件事
很多人一上来就问:用什么模型、装哪个插件、跑什么脚本。
我建议你把这些问题先放一放,先回答一个更根本的:你要的是一段文字,还是一套成品?
这两者差别很大。如果你要的是”帮你写一段商品介绍”,那随便一个聊天框就够了,成本几乎为零。
但如果你要的是”一张商品图进去,一整套能直接上架的素材出来”——10 版标题、一套卖点、一整页详情文案、十几张图,还都带尺寸规范——那你要的就不是一个聊天框,而是一条流水线。
搭智能体真正的门槛不在”让它会写”,而在”让它交付”。想清楚这一点,后面每一步才有判断标准。
第一步:给它一个身份,别让它当新手
一个智能体最先要有的东西不是能力,是身份。
说白了就是给它写一份人物设定:叫什么名字、干什么的、什么性格、什么风格、什么底线。电商这个场景,我特别强调了两条。
一条是风格上要求”说人话、不堆空话、交付完整”。这条不是修饰,它直接决定了输出质量。同样让它写详情页,写”匠心工艺、臻美品质”和写”外壳是铝合金,接口有 Lightning、USB-A、Micro-USB 三种”,是两种完全不同的东西。
另一条是底线:不生成违反广告法的绝对化用语,不做虚假宣传。电商文案最容易踩的雷就是”最””第一””国家级”这类词,一写就违规。这种事不能指望人在旁边一条条盯,得让智能体自己知道不能碰。
光有身份还不够,你还得给它三样像”人”一样的东西:一个长期记忆,存它该记住的核心事实和偏好;一个每日记事,记当天干了什么;一个知识库,把结构化的经验沉淀下来。
这三样不配,它每次对话都是新手,你昨天讲过的规矩今天它全忘。
第二步:装上”出图的手”,这一步最容易漏配
身份立好,接下来是让它能出图。这是整个搭建里最关键的一次能力升级。
选哪家出图服务可以先做个小对比:中文商品图理解得好的、图生图保真度高的、出图质量高的,各有各的强项。国内我最后用的是阿里云百炼(DashScope),主要是国内直连、图生图能传参考图、不用先上传到公网。海外的 Gemini、OpenAI 也能用,但需要外网环境,门槛高一截。
但这一步真正的坑,不在选谁,在配置。
接入一个出图能力,需要凑齐三样东西:用哪家服务、用哪个模型、以及一把身份凭证的钥匙。前两样是显式的选择,你会记得填;第三样是最容易被忽略的隐式依赖。
我第一次配的时候就漏了钥匙。前面服务商和模型都填好了,兴冲冲去测试,结果直接报错。排查半天才反应过来,我把钥匙忘了。这就好比你选好了餐厅、点好了菜,坐下才发现自己没带钱,一步都走不下去。
把钥匙补齐,文生图和图生图两条路立刻都通了。如果你照着搭,这一步记牢:配置能力大多是”服务商 + 模型 + 凭证”三件套,别只配前两样。
第三步:把现成的技能搬回来,别从零写
出图能力有了,接下来是让它干具体的活。这一步我强烈建议别从零写,去开源社区搬现成的。
我用了两个技能,分工很清楚。先把两个仓库地址放这里,你可以直接点进去看源码:
- 素材加工厂
ecommerce-material-studio—— 仓库 davepoon/buildwithclaude,技能在plugins/all-skills/skills/ecommerce-material-studio/下,进去先读 SKILL.md。 - 出图排版
goods-images—— 仓库 LeoYeAI/openclaw-master-skills,在 skills/goods-images 目录下。
第一个是”素材加工厂”型的。它负责的不是 AI 生成,而是合成——把已有的白底商品图合成到场景里、叠加文字和 Logo、做多平台尺寸适配、最后打包。一句话,AI 负责画,它负责组装和收尾。
第二个是”出图排版”型。它是纯提示词技能,没有脚本,就是一整套怎么出详情图和轮播图的指令,覆盖封面、细节、场景、参数、售后这些模块。因为不用跑脚本,它是两个里更好上手的一个,建议先把它跑通。
如果你要复刻,安装动作就三步:把仓库 clone 到本地,把技能目录整个拷进你智能体的 skills 目录,然后重启工作区让它重新扫描一遍技能。注意别只拷 SKILL.md 一个文件——技能目录里往往还有脚本和资源文件,少一个就跑不起来。
搬技能有两个动作不能省。一个是安全审查:检查有没有网络回传、有没有可疑的代码执行、有没有访问敏感路径。另一个是环境适配:别人的技能是在别人的环境里写的,字体路径、工具名、运行环境都可能对不上,得手动改过来。
第二个技能里有一条原则我觉得特别对,值得抄进你自己的版本——商品必须保真。就是 AI 出的图里,原商品的图案、文字、Logo、颜色,一个都不能变。很多 AI 出图工具的通病是画着画着把商品给改了,黑色外壳给你画成银色,这素材就废了。它的解法是靠图生图传参考图,让 AI 在保留商品原貌的前提下换场景。
第四步:拿一个真实商品跑通,然后重点盯”节奏”
技能装好,就该用真实商品验证一遍。
我拿的是一个三合一手机 U 盘,铝合金外壳、三种接口。整条流程跑下来是这样:先由视觉识别判断品类,再匹配一个风格,然后图生图出场景图、叠加排版出轮播图、AI 出详情图,最后打包。
结果是一整套东西:轮播图、详情图、场景原图,加上一个压缩包,从一张图到一套素材,一天之内跑完。
如果这篇你只记一件事,就记下面这段。
我实测下来最大的坑,是出图接口的限流,它比你想的严格得多。一开始我图快,并发几个请求一起发,结果大面积被拒,一张图都没出来。
后来改成串行——一次只发一个请求,每张图之间停二十秒,被拒了等十几秒再重试,最多重试八次。按这个节奏,十几张图整体要跑八到十二分钟。
这里有个连带影响:任务要跑十几分钟,你卡在前台等很容易超时,所以这类批量出图的活建议直接在后台挂着跑。
我想说的是,很多做 AI 应用的人,卡的不是”能力有没有”,而是”节奏对不对”。能力是有的、接口是通的、图也能出,但就是这几行”串行 + 间隔 + 重试”的调度,决定了它能不能稳定跑完。生产环境和演示环境的差距,往往就在这些不起眼的地方。
四步走完,它到底能给你什么
按这四步搭起来,你手上会有一个能交付成品的智能体,能力大致分三类。
文案类是拿到就能复制上架的:10 版不同风格的标题用来测款,一句话主卖点加三到五个分点论证加支撑证据,一整套详情页文案,再按平台调性做多平台改写。
图片类是拿到就能下载使用的:5 张带 Logo、卖点、活动条的轮播图,9 张从封面到售后的竖版详情图,3 张商品外观保真的场景图,还有白底转场景、多平台尺寸适配。
增值的是批量和交付能力:多 SKU 一次产出、自动质检图片比例和文字清晰度、打包成压缩包开箱即用。
照着抄:一份速查清单
如果你看完不想翻回去找,我把要用的东西集中列一份,可以直接抄。
- 身份与底线:写 AGENT.md,五要素(名字、角色、性格、风格、底线),底线里必须写死”不碰广告法绝对化用语”。
- 记忆三件套:
MEMORY.md(长期事实偏好)+memory/(每日记录)+knowledge/(结构化沉淀),三个目录都要建。 - 出图能力:阿里云百炼 DashScope,配置时
provider + model + API Key三样缺一不可。 - 技能一(加工厂):ecommerce-material-studio,负责合成、排版、适配、打包。
- 技能二(出图):goods-images,纯提示词,负责 AI 出详情图和轮播图。
- 字体:技能默认字体路径多半对不上,换成系统里真实存在的中文字体(我用的 Fandol)。
- 调度:出图改串行,每张间隔 20 秒,失败重试,并且放后台跑。
把这份清单从头到尾走一遍,你手上应该就有一个能跑的了。剩下的就是拿真货去磨。
最后说句实在话
回头看,搭这个智能体最花时间的,全在”让它能交付”这一步。
让它会写文案,一下午就够了。但要让它交付一套能直接上架的素材,你得考虑商品保真、中文渲染、平台尺寸、接口限流、异常重试、打包格式,每一环都可能绊你一跤。
不过我依然觉得值得。因为智能体真正的价值,从来不是”AI 会不会写”,而是”写出来的东西、做出来的图,能不能直接拿去用”。
四步听着简单,难的是每一步都别偷懒。你先把它搭起来,剩下的,交给真实商品去打磨。












