一张商品图进去,一整套素材包出来
前几天我在另一个工作区搭了个电商内容智能体,取名叫“1电商”。
它的任务很单纯:你把一张商品图甩给它,再补一句产品描述,它还你一整套能直接上架的素材。
具体是多少东西呢,一张单品图能变出:10 版标题、一套卖点体系、一整页详情页文案,外加 14 张商品图。
搭完之后我拿一个三合一手机 U 盘做了全流程实测,从早上丢进去一张图,到晚上拿到一个 19.2MB 的素材压缩包,一天之内跑完了。这篇把整个过程和踩的坑都记下来,尤其是最后那个 API 限流的坑,我认为是全文最值钱的一段。
下面这些就是那天实际产出的素材,先放几张感受一下成品长什么样。

这是一张由智能体生成的主图,从商品图到场景、到卖点文字、到版式,都是它自己排出来的。
先说清楚它跟普通“AI 聊天”的区别
很多人对智能体的理解还停在“会聊天”,你问它一句,它回你一段。
我搭这个东西的出发点不一样。我不想让它当一个“会写文案的聊天框”,我要它能交付成品。
这个区别很关键。聊天框给你的是文字,你得自己复制、自己排版、自己配图、自己改尺寸、自己打包。成品不一样,成品是你拿到手就能上传后台、直接上架的整套东西。
所以它的能力被拆成三块:
- 文案端。批量标题、卖点提炼、完整详情页文案、多平台改写。
- 图片端。AI 出场景图、轮播图、详情图,再叠加文字和 Logo。
- 交付端。多 SKU 批量、自动质检、打包成 zip。
说白了就是一句话:别人给你一堆工具,我给你一套成品。
第一步:先把智能体的身份立起来
搭智能体的第一件事不是写代码,是给它一个身份。
我给它写了一个身份文件,把这个智能体的名字、角色、性格、风格、底线全部定义清楚。
名字叫“1电商”,角色是商品文案与详情页批量生成专家,性格要求专业高效、有商业嗅觉、懂平台规则也懂消费者心理。
风格上我特意写了一条:专业但不死板,说人话不堆空话,交付要完整详尽。
底线也写死了:不生成违反广告法的绝对化用语,不做虚假宣传。这条很重要,电商文案最容易踩的雷就是“最”“第一”“国家级”这类词,一写就违规,智能体必须自己知道不能碰。
身份之外还要配三样东西,跟人一样:
- 一个长期记忆文件,存核心事实和偏好。
- 一个每日记事文件,记当天干了什么。
- 一个知识库,把结构化的东西沉淀下来。
这三样配齐了,智能体才会有连续性。不然它每次对话都是新手,昨天讲过的规矩今天全忘。
第二步:给它装上一双“出图的手”
这是这次搭建里最核心的增量。
原来的电商智能体只会写字,你让它出图,它出不了。这次我要让它从“只会写字”升级成“能出图”。
出图的方案我先做了轮对比:
- 火山引擎的方案,中文商品图理解得最好,作为备选。
- 阿里通义这一套,电商场景强,图生图的保真度高,我选了它。
- Gemini 出图质量是天花板,但要外网,不方便。
- OpenAI 的图生成稳定,也留着当备选。
选阿里还有个实际原因:它支持把参考图以内联的方式传进去,不需要你先把商品图传到公网拿个 URL。对我这种本地跑的场景来说,省了大事。
踩坑记录:选好了餐厅,没付钱
配置出图能力需要三个东西凑齐:用哪家服务商、用哪个模型、以及最关键的一把钥匙。
我配前两项的时候手很顺,服务商填了,模型填了,然后就跑去测试。
结果报错。
排查半天才反应过来,我把钥匙忘了。这就好比你选好了餐厅、点好了菜,坐下才发现自己没带钱,一步都走不下去。
把钥匙补齐,文生图和图生图两条路立刻都通了。
这个坑不大,但很典型。现在很多能力的接入都拆成了“选服务商 + 选模型 + 配凭证”三件套,前两件是显式的选择,你会记得做;第三件是隐式的依赖,最容易漏。
第三步:从技能市场搬两个现成的技能回来
出图能力有了,接下来是让它干具体的活。
我没有从零写,而是从开源社区搬了两个现成的技能(Skill)回来改造。
技能一:电商素材工坊
第一个技能来自 GitHub 上 davepoon 的 buildwithclaude 仓库,路径在 plugins 目录下面的 all-skills。
它的定位不是我前面说的 AI 生成,而是图片的合成加工厂。它做的事情是:把已有的产品白底图合成到场景里去,叠加文字和 Logo,做多平台尺寸适配,最后打包。
说白了,AI 负责画,它负责组装和收尾。
接入的过程比想象中麻烦,我列一下:
- 下载。原始域名被墙了,我改用 GitHub 的 API 接口,把 17 个文件逐个拉下来,大概 340KB。
- 安全审查。这是必做的一步,检查有没有网络回传、有没有可疑的代码执行、有没有访问敏感路径。查完通过。
- 装依赖。给它建了一个独立的虚拟环境,把图片处理的几个库装进去。
- 中文字体。这个技能原本用的字体不支持中文,我额外下了 6 个中文字重,把代码里的字体路径改过来。
- 实测。场景合成、文字叠加、中文渲染,全部跑通。
技能二:商品图生成
第二个技能来自另一个开源仓库,LeoYeAI 的 openclaw-master-skills,路径下的 goods-images。
它是个纯提示词型的技能,没有脚本,就是一套怎么出淘宝天猫京东详情图和轮播图的指令。所以我下载完审查了内容就直接用了,只需要加一段“本地运行环境适配”的说明,把工具名、字体、环境路径对上去。
这个技能里有一条核心原则我觉得特别对:商品必须保真。
什么意思?就是 AI 出的图里,原商品的图案、文字、Logo、颜色,一个都不能变。很多 AI 出图工具的毛病就是画着画着把商品给改了,本来是个黑色铝合金外壳,它给你画成银色,这素材就废了。它的解法是靠图生图传参考图,让 AI 在保留商品原貌的前提下换场景。
第二条原则是用户零操作,后台自动完成,用户只管对话。
第三条是环境自适应,能用本地图片库处理就本地处理,处理不了才降级到 AI 生成。
第四步:拿一个真实的商品跑全流程
两个技能装好,我用一张三合一手机 U 盘的图做了全链路验证。
这是一张铝合金外壳的商品图,接口有 Lightning、USB-A 和 Micro-USB 三种。

整张图就是这么一张产品图,剩下的全交给它。
整个流程是这样跑的:
- 视觉识别,判断出这是数码 3C 类的三合一手机 U 盘。
- 风格匹配,选定了科技未来风,深空黑打底,青蓝点缀。
- 图生图生成 3 张场景图,商品外观、接口、质感全部保持。
- 用图片库叠加排版,做出 5 张轮播图,带上 Logo、卖点和活动条。
- AI 生成 9 张详情图,覆盖封面、卖点、细节、场景、参数、售后这些模块。
- 打包交付。
这一步里,图生图生成的三张场景图是这样的:


可以看到手机、电脑、桌面这些元素是重新生成的,但 U 盘本身的接口、材质、比例没动,这就是前面说的“商品保真”。
最后产出的东西:轮播图 5 张,800 乘 800;详情图 9 张,1024 乘 1536 的竖版长图;场景原图 3 张,1024 乘 1024。打成一个 19.2MB 的压缩包。
轮播图一组,五张的版式是统一的,只换卖点和场景:



全链路跑通,商品保真效果不错,中文渲染也清晰。从“一张图”到“一整套素材包”,一天之内完成。
最重要的经验:API 限流那一关
如果这篇文章你只记一件事,就记这一段。
我实测下来最大的坑,是图片生成 API 的限流。它比你想的要严格得多。
一开始我没当回事,想着 14 张图,我并发几个请求一起发,快一点。
结果撞墙了。大量请求直接被拒,返回的是一串限流错误码,一张图都没出来。
改成什么方式呢:
- 串行。一次只发一个请求。
- 间隔 20 秒。每张图之间停 20 秒再发下一张。
- 失败重试。如果被拒,等 15 到 20 秒再重试,最多重试 8 次。
按这个节奏,14 张图整体要跑 8 到 12 分钟。
这个时间长度有个连带影响:整个任务要跑十几分钟,你要是卡在前台等,很容易触发超时。所以我建议这类批量出图的任务直接在后台挂着跑,别死等。
这里我想多说一句感悟。很多做 AI 应用的人,卡的不是“能力有没有”,而是“节奏对不对”。
能力是有的,接口是通的,图是能出的。但就是这几行“串行 + 间隔 + 重试”的调度,决定了这件事能不能稳定跑完。生产环境和演示环境的差距,往往就在这些不起眼的地方。
还剩几个小坑,顺手记一下
除了限流,还有几个零碎的坑值得记:
- 原始下载域名被墙,改走 GitHub 的 API 接口,拿到的是 base64 内容,解码就是原文件。
- 系统自带的 Python 受环境管理限制,装不了包,得用独立的虚拟环境。
- 素材工坊里有个合成函数,返回的不是图片对象本身,得从它身上再取一层才拿到图,这个跟文档写的不一样。
- 某个配置文件的字段结构跟文档对不上,实际跑起来才发现真实字段名是另外两个。
- 技能代码里字体路径是写死的,换系统就找不到,必须手动改成自己的路径。
这些都是文档不会告诉你、只有真跑一遍才知道的东西。它们单个看都不致命,但攒在一起,就是“看着能跑”和“真的跑通”之间的差距。
最后,它到底能交付什么
跑完之后我把能力梳理成三类,方便别人理解。
文案类,拿到就能复制上架
- 批量标题,一次出 10 版,覆盖关键词型、卖点型、场景型、情绪型、促销型几种风格,用来测标题。
- 卖点提炼,一句话主卖点,加三到五个分点论证,再加材质参数认证这些支撑证据。
- 完整详情页文案,从主图文字到卖点模块到参数表到场景描述到信任背书到行动号召,一整套。
- 多平台改写,同一个产品按平台调性改,标题字数、违禁词、语言风格各平台不一样。
图片类,拿到就能下载使用
- 轮播图 5 张,带 Logo、卖点、活动条。
- 详情图 9 张,竖版长图,从封面到售后一整套。
- 场景图 3 张,用图生图保持商品原貌。
- 白底图转场景图,叠加文字和 Logo。
- 多平台尺寸适配,淘宝京东拼多多抖音小红书亚马逊都能对。
批量与增值
- 多产品多 SKU 一次产出,格式统一。
- 自动质检,检查图片比例、文字清晰度、风格一致性。
- 打包成 zip,开箱即用。
- 每次任务的踩坑经验写进记忆,越用越准。
怎么用它
用法很简单,三步。
第一步,给素材。一张商品图,白底或实拍都行,加一句产品描述,把品名、卖点、目标人群说清楚,越全越好。
第二步,说需求。可选,但说了更好。目标平台、价格定位、目标人群、品牌名和 Logo、必带关键词、特殊要求,填了它就更贴。
第三步,收货。它先出 10 版标题让你挑方向,再出卖点体系和详情页文案,同时后台批量出图,最后打包给你。
回到起点
整个过程下来,我最大的感受是:搭智能体这件事,难的不是“让它会”,是“让它能交付”。
让它会写文案,一下午就能做到。让它交付一套能直接上架的素材包,要考虑商品保真、中文渲染、平台尺寸、接口限流、异常重试、打包格式,每一环都能绊你一跤。
我搭这个“1电商”的初衷,就是想试试把“会”推到“交付”这一步。跑通之后回头看,真正花时间的全是后面那些不起眼的活。
而这也正是智能体有意思的地方:它不解决“AI 会不会写”的问题,它解决“写完的东西,能不能直接拿去用”的问题。
另外,如果你也在搭智能体,可以看看我之前写的一篇 关于系统级应用控制的做法,那篇和这篇算是同一个思路下的两块拼图:一个管“能碰到什么”,一个管“能交付出什么”。







