Target 旗下的同日配送平台 Shipt 推出 AI 购物助手 "Ask Shipt",可根据用户提示自动生成可直接购买的购物车,例如为 25 人周六尾门派对搭建含早午餐商品的购物车、为家庭准备简易校园午餐及课后零食、按预算推荐家庭晚餐方案,也能上传菜品照片自动识别并加入食材。该工具是配送行业 AI 化趋势的一部分:同日早间 Instacart 上线 AI 助手 Clementine,Uber Eats 和 DoorDash 今年也已推出类似功能。Ask Shipt 已在 Shipt App 和 Shipt.com 上线,与 Target.com 近期的 AI 图片搜索、评论摘要等个性化功能形成协同。
全部资讯
作者 kqr 发布了一款新的 AI 代码注释分类器,相比此前依赖私人数据的旧版,新版完全基于公开数据重建。文章介绍其整体表现:交叉验证平衡准确率约 77%,F1 分数 77%,混淆矩阵显示人类注释 73% 被正确判定、机器人注释 80% 被正确识别;在非合成真实评论的小型测试集上准确率提升至 88%。模型在置信度 80% 以上时误判率仅 5%。在数据收集环节,作者从 2021 年的开源仓库中提取人类注释,并让 GPT、Gemini、Claude、Kimi、Grok、GLM 等大模型生成对应注释,期间因主体泄漏、注释未剥离、过短注释、固定 prompt 等问题反复重采数据。特征工程涵盖词长、词频、字符与词级别的 n-gram、词性标签 n-gram 等,并通过多轮筛选与组合确定生产用特征集。分类阶段先做 7 路判别,再压缩到 5 路并重归一化为人类/机器人二分类,附带温度校准。最终模型以网页形式发布,支持点击文本查看特征激活,体积约 355 KB,分类过程在浏览器内完成。作者表示因精力有限未再继续迭代,且 SourceHut 新 TOS 禁止托管 LLM 生成代码,项目源码留在 Sour
本期《AI Valley》头条关注两大主线:OpenAI 宣称其未发布模型调用约一万个 AI 智能体协同工作约88小时,求解了悬而未决近90年的千禧年数学难题 Navier-Stokes,随后由 GPT-6 Astra 用 Lean 形式化验证17小时;但相关数学家指控 OpenAI 接触其一年研究成果后抢先冲击,并迫使其在 Anthropic 任职的共同作者退出,且 OpenAI 尚未公开实际证明。同时,前 OpenAI 与 Anthropic 研究员 Jacob Coxon 宣布辞职,警告行业正不加节制地冲向自我改进的超级智能,Anthropic 对齐科学负责人 Evan Hubinger 称 AI 在十年内灭绝人类的概率达10%以上,多名研究人员公开声援,呼吁实验室减速甚至暂停能力提升。栏目还附带 DNSMOS 校准广告、OpenAI 试图压制电影《Artificial》、韩国向全民开放免费生成式 AI 等简短资讯与多款 AI 工具推荐。
OpenAI 发布 GPT-6 Astra,作者评测认为其计算机使用和图像渲染能力尤为突出,ARC-AGI-3 达 99.9%,前代 GPT-5.6 Sol 仅 7.8%。 🔗 阅读原文 via AIHOT · https://aihot.news/items/cmtud99z117yurofph84r3cio
阿里技术团队主导的 Apache Paimon C++ 项目正式发布首个 Apache 基金会版本 v0.3.0。该项目源于 2024 年 1 月阿里集团统一采用 Apache Paimon 作为数据湖表格式,为解决 ODPS、StarRocks、Native Flink、Native Spark 等 C++ Native 引擎无法依赖 JVM 处理 Paimon 表语义的难题而创建。Paimon C++ 通过 Arrow C Data Interface 实现批式数据交换,并提供 FileFormat、FileSystem、MemoryPool、Executor 等深度可定制插件,同时保留 ORC、Parquet、Avro 等默认实现和元数据缓存。功能上支持 Append 与主键表的 Scan、Read、Write、Commit、Compaction 全链路,覆盖 Merge-on-Read、Deletion Vector、Data Evolution、多模态数据及全局索引检索。性能方面通过分层 Spill Merge、并行预取、异步 Row-to-Batch 和 COUNT(*)
字节跳动推出基于豆包大模型的AI输入法「豆包输入法」,支持Android、iOS、macOS和Windows全平台,主打深度整合AI的语音识别能力。该输入法采用Seed-ASR语音识别模型,中英文测试集错误率比同类产品降低10%-40%,支持普通话、英语、粤语及中英文混合识别,能结合上下文智能整理输出、过滤口头禅并自动添加标点。Windows桌面版于2026年9月正式发布,Mac版此前已上线,用户可按住或双击Option键触发语音输入。产品还提供AI智能联想、轻声说话模式和约150MB的离线语音模型,界面简洁无广告,并支持智能输入(云端)与基础输入(纯本地)两种隐私模式供用户切换,免费使用。
深度求索宣布将于9月10日前后正式发布DS V4.1 Flash模型,该模型在性能、费用、速度和总用时等指标上全面超越DS V4 Pro。发布后,API平台上用户发出的V4 Pro请求将自动路由到DS V4.1 Flash,并按新模型价格计费,使用成本更低。V4.1 Pro发布后,原V4 Pro调用将继续路由至V4.1 Pro。目前用户可通过将模型名称改为deepseek-v4.1-flash-expires-on-0910提前测试中间版本,该版本响应快、token效率高。Flash定价区分闲时与高峰时段,闲时缓存命中0.20元、未命中1.00元、输出4.00元;高峰缓存命中0.04元、未命中2.00元、输出8.00元,高峰为工作日09:00-12:00和14:00-18:00。
懂车帝接入火山引擎 AI MediaKit,搭建可组合的音视频处理底座,应对汽车内容平台三类创作挑战:营销视频素材复用导致成片相似度过高、UGC 用户素材加工门槛高、底层媒体处理能力难以跨业务复用。双方采用"模型能力 + 媒体处理工具"协同架构,由懂车帝多媒体基建负责业务规则与工作流,模型负责内容理解与生成,AI MediaKit 以原子接口形式执行裁剪、拼接、翻转、倍速、贴片、转场、字幕及画质处理等任务。该方案支撑营销视频批量多样化生产,并将同一套工具底座复用于 UGC 一键成片,覆盖高光剪辑、Vlog、口播视频等场景,降低视频创作门槛,提升规模化处理效率。
火山引擎日志服务 TLS 推出 LLM 应用可观测最佳实践,针对智能助手等 AI Agent 应用的运行过程黑盒问题,提供全链路透明化能力。方案核心是 TypeScript LLM Observer SDK:应用仍通过 OpenAI 兼容客户端调用火山方舟等模型服务,SDK 负责采集模型调用、Token 消耗、耗时和错误信息,并遵循 OpenTelemetry GenAI 语义约定转换为标准化 Trace,通过 OTLP/HTTP 上报至 TLS Trace Topic。SDK 在业务请求外层创建 Agent Span,将模型与工具调用生成 Model Span 与 Tool Span,关闭正文采集时仍保留观测元数据,并支持通过环境变量控制避免密码、AK/SK 等敏感信息上报。AgentLoop 前端提供 Session、Trace 和调用链三类仪表盘:会话分析按 session.id 聚合多轮请求,Trace 分析展示单次请求的 Token、耗时与状态,调用链分析还原 Agent、Model、Tool Span 的父子关系,可用于精准排障、成本优化与完整复盘。文章还介绍了演进方向,包
Hacker News 上围绕一篇付费墙文章展开讨论,主题是 1990 年《纽约客》刊登的讽刺短文《Coyote vs. Acme》,该短文将 Looney Tunes 中 Wile E. Coyote 起诉 Acme 公司的情节写成荒诞法律故事,并被改编为同名电影。讨论呈现两极化:部分评论者将它视为童年回忆加持的轻松怀旧合家欢娱乐片,认为客串与彩蛋有效,适合作为消遣;另一部分评论者认为影片笑点重复、剧情平淡、完成度不及《Who Framed Roger Rabbit》。此外,线程还涉及提前入场遭遇 33 分钟影院广告的糟糕体验、对导演人选的质疑,以及转载付费内容是否符合 HN 开放分享精神的争论。