突然提速?ChatGPT Pro思考时间大幅缩短,引发用户对服务降级担忧
近日多位重度用户发现ChatGPT Pro模型行为异常,原本...
近日多位重度用户发现ChatGPT Pro模型行为异常,原本...
开发者Sai近日发布开源项目Polox AI的新版本,这是一个面向图像与视频处理方向的AI Agent工具。本次更新的核心是优化图像内文字编辑能力:项目引入大语言模型(LLM)自动检测图片中的文字坐标,并在画布上以序号标记,与对应的文本编辑框绑定显示。用户可直接通过序号定位需要修改的文字内容,无需手动框选文字区域。这一交互设计对于文字较多的图片(如海报、截图、设计稿等)尤为实用,可显著降低逐个查找和编辑文字的操作成本。项目代码托管在GitHub平台,以开源方式发布,开发者可直接访问仓库获取代码并参与迭代。作者Sai在V2EX开发者社区分享了此次版本更新信息,并向社区用户征求使用反馈。从产品形态看,Polox AI属于AI Agent在图像编辑垂直场景的具体落地,尝试将LLM的语义理解能力与画布交互相结合。以往修改图片内文字通常依赖Photoshop等专业软件手动操作,或借助通用AI绘图工具整体重绘,而该项目聚焦文字精准编辑这一细分痛点,以坐标检测加序号映射的方式提供了解决方案。
核心观点:AI图像编辑正从整体重绘走向精准控制:让LLM负责找字、人类专注改字,垂直分工可能比端到端生成更实用。
原文链接:V2EX 分享发现
开源大模型API网关项目new-api发布v1.0.0-rc.38版本,本次更新引入Responses WebSocket支持与请求策略两大核心功能。在系统设置层面,新版本新增请求策略模块,支持集中配置请求检查、会话管理、重试机制与渠道健康监测,并在使用日志中记录策略决策详情,便于管理员排查与审计。渠道管理方面,渠道创建与编辑界面补充了快捷选项和透传说明,新增模型重定向工作台;高级自定义渠道可按路径单独开启透传功能。同时,该版本新增vLLM与SGLang两种推理引擎渠道,Ollama渠道则支持按渠道粒度开启OpenAI兼容对话接口。new-api是从One API发展而来的开源项目,为多种大模型服务提供统一的API接入、分发与管理能力,在个人开发者与企业私有化部署场景中被广泛使用。此次更新后,用户可通过WebSocket长连接调用支持实时交互的模型接口,并借助策略系统实现更精细的流量治理与渠道调度。该版本已在GitHub发布,完整更新说明可前往项目仓库查看。
核心观点:API网关正从密钥分发走向策略化治理,开源社区在补齐大模型自托管基础设施的关键一环。
原文链接:Linux.do
一位开发者在发现冰箱里有一根放置了三个月的黄瓜后,开发了一套面向AI Agent的家庭仓储管理系统AL1S-WMS,并将项目开源至GitHub。该系统将全部功能封装为MCP tools,用户只需拍摄购物小票,Agent即可自动识别并完成入库。库存管理方面,系统支持按批次入库、条形码扫描,可记录保质期、存放位置、分类等属性;预警功能覆盖临期、过期、临界、库存不足、缺货等多种状态;采购模块提供购物清单、购物日历、购买后入库以及缺货物资自动生成购物清单;财务模块则包含当月预算规划、支出统计和简易记账。作者明确说明该项目不适用于企业、门店等专业商用场景,不具备银行账户同步、多币种换算、ERP级批量作业等能力,定位为个人自用工具。目前系统已支持多家庭切换,但尚未实现多用户功能。为解决已有物品批量录入的难题,作者将Agent接入QQ,在家中走动时通过语音消息播报物品位置和数量,即可完成信息录入,实现边走边管的库存维护体验。
核心观点:当Agent成为操作主体、人只需开口说话,个人软件的开发逻辑与使用方式正被AI重新定义。
原文链接:V2EX 分享发现
一位开发者在 GitHub 上开源了 everything-search-skill 项目,这是一个面向 AI Agent 的文件搜索技能,核心思路是让 Agent 调用经典 Windows 搜索工具 Everything 来完成文件检索,替代 Agent 默认的 glob 等模式匹配方案,从而将搜索速度提升约一倍。Everything 是知名的 Windows 全盘文件搜索工具,基于 NTFS 文件系统的主文件表(MFT)建立索引,能够在海量文件中实现即时定位,长期被视为 Windows 平台近乎必装的效率软件。项目作者认为,当前大模型的推理速度虽然在持续提升,但 Agent 在执行文件搜索这类系统级操作时,仍依赖低效的遍历式方案,搜索环节往往成为整个任务流程的性能瓶颈,而接入 Everything 后这一短板可被显著弥补。该项目实现并不复杂,通过封装 Everything 的命令行接口,让支持技能(Skill)机制的 Agent(如 Claude Code)可以直接调用。作者表示此类技能用户完全可以自行编写,开源此项目旨在提供现成方案,并希望获得社区 star 支持。该内容来自 V2EX 分享发现板块,属于开发者工具类项目分享,原文行文风格较为随意,但所指项目具备一定实用价值。
核心观点:Agent 的效率瓶颈常在工具链而非模型本身,经典桌面软件与 AI 技能结合是低成本高回报的增强路径。
原文链接:V2EX 分享发现
一项针对 Coding Agent 代码检索方式的实测研究显示,为 Agent 接入基于 LSP 的语义导航(查引用、跳定义、列符号)并不一定优于传统的 grep 搜索。研究使用 Opus 4.8、Sonnet 4.6、Haiku 4.5 三个 Claude 模型,在多个 Python 和 TypeScript 仓库上测试了定位代码、查找全部引用、多文件重命名三类任务,且仅统计两种方法均成功的情况以公平对比 token 消耗。结果显示:在简单定位代码的任务中,模型几乎不主动选择 LSP(主动选择率 0% 至 6%),强制使用 LSP 反而使成功率从 100% 降至 89%;在查找全部调用方的任务中,模型主动选择 LSP 的比例为 45% 至 57%,精确率从 grep 的 0.76 提升至 1.00,但两者的召回率均只有约 0.66。实验还发现,代码库中同名文本越多,LSP 的收益越明显:hono 仓库的 grep 精确率仅 0.51,改用 LSP 后 F1 提升 0.246 且节省 12% token;而在代码命名干净的 remeda 仓库中,LSP 基本无效,token 反而多消耗 16%。影响最大的改动与检索后端无关:将 LSP 返回内容从文件路径和行号改为直接附带上下文源码后,多文件重命名 pass@1 从 0.67 升至 0.83,多余文件读取从 15.2 次降至 3.2 次,低于纯 grep 的 4.3 次。研究的结论是,LSP 的效果取决于任务类型和代码库特征,而工具返回内容的格式,有时比检索后端本身对结果的影响更大。
核心观点:给 Agent 配工具,返回格式与任务场景的匹配度,比检索后端的精确度更决定成败。
原文链接:V2EX 分享发现
DeepSeek官方宣布了一项面向开发者的API计价新政:在法定节假日期间,以及因调休安排而变为休息日的周末,通过DeepSeek官方API调用模型服务可全天享受谷时价格。根据DeepSeek现行的分时定价机制,其API服务区分峰时与谷时两个档位,谷时通常为北京时间凌晨00:30至08:30,该时段平台计算资源相对空闲,价格明显低于常规时段。此次新政意味着在上述假期内,全天24小时均可按谷时优惠价调用,包括DeepSeek-V3、R1等模型在内的推理服务成本将显著下降。对开发者而言,这是一项实打实的成本利好:批量数据处理、离线任务、大规模文本生成、模型评测等原本需要卡准凌晨谷时窗口的工作负载,可以在节假日全天灵活执行,既降低调用费用,也提升了任务排期的自由度。据了解,DeepSeek此前曾在春节期间试行全天谷时计价并获得开发者好评,此次将优惠范围明确扩展至全部法定节假日及调休周末,表明该策略已从临时性活动转为常态化机制,持续向开发者让利。
核心观点:节假日全天谷时计价既是闲置算力的削峰填谷,也是DeepSeek用低价护城河持续巩固开发者生态的既定打法。
原文链接:Linux.do