开源工具EditHere:截图批注直传AI,精准修改生图、前端与视频

开发者在Linux.do社区发布开源项目EditHere,定位为一款帮助用户精准修改AI生成内容的交互工具,覆盖AI生图、前端页面、游戏和视频等场景。项目的出发点在于:使用AI开发应用或生成内容时,用户往往只能通过对话框用自然语言描述修改需求,难以传达精确的调整意图。现有批注工具如Agentation仅适用于已组件化的HTML结构,需要工具先读取组件再向AI表达修改意见,无法覆盖无法直接获取结构的前端或画面。EditHere采用相反思路:直接对画面截图,由用户在截图上批注,工具将批注结果转换为JSON格式后交给AI,由AI自行理解组件和修改意见。作者称该方式适用于所有前端页面,并可扩展至AI生图和视频制作。在生图场景中,该工具支持一次性表达多个修改需求及位置关系变化,通过减少修改次数来保留原图细节;在视频和游戏引擎场景中亦有对应用例演示。项目强调自身不绑定特定Agent,而是作为用户与Agent之间的通用交互接口,代码已在GitHub上完整开源,并遵循社区的开源推广规范。

事件分析

该项目的核心看点在于交互范式的转换:传统批注工具需先解析组件结构再传递修改意见,而EditHere将理解结构的负担转移给AI,仅传递视觉层面的批注信息。这种思路与多模态大模型能力提升的趋势相吻合——当模型的图像理解足够强时,截图加批注的低保真输入即可支撑精准修改。从产业视角看,此类工具反映了Vibe Coding工作流中反馈环节的空白:生成能力强、迭代反馈弱的矛盾正催生一批中间件型工具,EditHere选择做通用接口而非绑定特定Agent,是较为务实的卡位。潜在挑战包括批注JSON的表达精度上限、复杂布局歧义的处理能力,以及能否与主流Agent框架形成稳定集成。若实际效果得到验证,’视觉批注即输入’的模式有机会成为人机协作开发流程中的标准环节。

核心观点:把’描述需求’变成’标注画面’,多模态时代的人机开发协作正从语言接口走向视觉接口。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册