科研绘图实测:Grok-image-2 虽细节略逊,但新增“元素提取”功能远超 GPT

近日,针对AI生图模型在专业科研领域的表现,有开发者进行了专项对比测试。测试选取了AAAI26顶级会议中的一篇学术论文配图,通过反向提取提示词的方式,将相同的指令分别输入至xAI旗下的Grok-image-2与OpenAI的GPT-image-2模型中。测试结果显示,两者在输出风格上存在明显差异。Grok生成的图表在版面布局上更为规整严谨,高度契合科研绘图对结构规范性的要求,但在局部纹理和视觉细节的丰富程度上稍显不足。相比之下,GPT-image-2虽然在细节刻画上更具优势,但在整体构图的规整度上略逊一筹。除生成质量外,测试还发现了一个关键的功能差异。Grok平台目前支持直接识别并提取生成图片中的特定元素,允许针对局部进行二次修改或单独下载素材。这一“元素级编辑”能力打破了传统AI绘图“一次成型、难以修改”的限制,为需要频繁调整图表内容的科研人员提供了极大的便利。该测试表明,在科研绘图等专业领域,模型的功能性与工作流整合度正成为比画质更重要的评价指标。

事件分析

此次对比揭示了AIGC应用在垂直场景下的新需求。对于科研人员而言,图像的“可编辑性”往往比单纯的“美观度”更具实际价值。Grok能够直接提取图片元素,暗示其在底层多模态模型中可能集成了更强的对象分割或图层控制能力,或者是在应用层集成了类似设计软件的图层逻辑。这表明,未来的图像生成模型竞争,将不再局限于生成效果本身,而是会向设计工作流的上下游延伸,通过集成编辑工具来增强用户粘性。

💡 核心观点:图像生成竞争正从画质比拼转向可编辑性,Grok的元素提取功能为科研绘图等垂直领域提供了更具实用价值的工作流。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册