近日,马斯克旗下 xAI 正式推出 Grok Imagine Image 2.0 图像生成模型,在 LMSYS Chatbot Arena 的文生图和图像编辑双榜上空降全球第二,仅次于 OpenAI 的 GPT-Image-2。这款模型最大的突破在于支持可交互的精准编辑功能,上传图片后 Grok 会自动进行智能分层,用户可以精确选择特定区域进行修改。

一、智能分层编辑:AI 生图进入精细化时代
Grok Imagine Image 2.0 的核心亮点是自动图层分离技术。当用户上传一张图片时,系统会自动识别并分割图片中的各个元素。以一张维基百科表情包为例,Grok 会将地球的每一块碎片、人物的手势动作和人脸分别识别为独立图层。用户只需点击图层右侧的下载按钮,就能将任意主体导出为透明背景图片,这一功能在设计工作中尤为实用。
这种分层编辑能力在社交媒体内容创作中极具实用价值。用户无需掌握专业的 Photoshop 技能,只需上传一张普通照片,就能快速将其转化为各种风格的表情包或创意图。魔棒工具可以框选编辑区域,弥补自动分层无法覆盖的范围,让编辑更加灵活。多参考编辑功能支持一次处理最多 5 张输入图像,实现自动拼接融合,为创意合成提供了更多可能性。此外,模型还支持生成各种复杂的信息图、广告、游戏素材、UI/UX 模型、故事板等,覆盖了商业设计的多个场景需求。
二、交互式编辑体验:从"生成"到"精修"
与 GPT-Image-2 主要依靠提示词控制不同,Imagine Image 2.0 提供了更直观的交互界面。用户在生成图片后,右侧边栏会显示系统自动识别去除背景后的图层列表,如红色夹克、白色 T 恤、Logo 等元素。选择对应元素后输入提示词即可进行修改,无需重新生成整张图片,大幅提升了编辑效率,节省了反复尝试的时间成本。
经典的"分心男友"表情包可以直接替换各区域内容;会议室白板图的每个对话框都会被自动识别,只需点击气泡框就能填入文字生成纵向漫画。这种"所见即所得"的编辑方式,让普通用户也能快速完成复杂的图像编辑任务,降低了 AI 生图工具的使用门槛。当然,Imagine Image 2.0 也有严格的内容审核机制,涉及版权人物或敏感内容的生成会受到限制,用户在使用时需要注意这一点,以确保创作内容符合平台规范。
三、市场定位:与 GPT-Image-2 的差异化竞争
在 GPT-Image-2 几乎统治 AI 生图市场的当下,Imagine Image 2.0 选择了一条差异化路线:与其追求极致画质,不如在编辑交互上做深。当前大模型竞技场上也出现了 OpenAI 测试中的 GPT-Image-2 后续版本(代号 mona-lisa-1),新模型在真实感和 AI Slop 感方面有所改进,但整体提升幅度不大,业界仍在期待更大的突破。
对于普通用户而言,Imagine Image 2.0 的分层编辑让"万物皆可表情包"成为可能,但严格的审核也限制了部分创意空间。从商业模式来看,xAI 采用低价策略抢占市场,单张图像编辑成本仅需 0.05 美元,相比 GPT-Image-2 更具价格优势,这对于需要大量生成图片的用户来说是一个重要的选择因素。体验地址:grok.com/imagine,支持网页端、iOS 与安卓移动端应用,同时开放配套开发者 API 接口,商业用户可直接集成到产品流程中,实现自动化图片生成与编辑。


