议
词 历英文社区 24 小时 AI 讨论热度 · 仅録不评
3 项 · 截自 八月二十六日 16:30
SemiAnalysis 评测 OpenAI 自研推理芯片 Jalapeño,称其 token/每 MW 吞吐优于 Nvidia Blackwell,但真正对手是采用 HBM4 的 Rubin。CarWatch 用 Raspberry Pi 5 加行车记录仪和本地 AI 实现离线聊天室 agent。arXiv 论文提出 Agentic Context Management 概念,主张把 agent 记忆与成本问题当作生命周期问题处理。
-
OpenAI Jalapeño:优于Nvidia Blackwell
SemiAnalysis 评测 OpenAI 自研推理芯片 Jalapeño,称其在 token/每 MW 吞吐上优于 Nvidia Blackwell,但指出对比 Blackwell 不完整,真正对手是采用 HBM4 的 Rubin。Jalapeño 与 Broadcom 合作、2024 年中启动设计,约 16 个月完成 tape-out,定位通用推理芯片而非仅适配 OpenAI 模型,未用 speculative decoding、无 prefill-decode 分离,在 DeepSeek-R1 上并发 1 时达 700+ tok/sec/user,Kimi-K2.5 与 GPT-OSS 约 1400 tok/sec/user,GSM8K 评测与 Nvidia 持平。讨论焦点是 token 价格下行:有人称硬件进步使价格持续下跌,也有人指 Jevons 悖论下更便宜 token 会推高总能耗,另有评论认为需求按人均增长、若用量增速超价格降幅总支出仍升,并猜测千级 tok/sec 或解锁实时机器人决策、带来需求暴增。
外站https://newsletter.semianalysis.com/p/openai-jalapeno-bet...
-
Show HN:我用Qwen打造了树莓派本地车载AI
Show HN 项目 CarWatch:用 Raspberry Pi 5 加行车记录仪和本地 AI 把车变成聊天室 agent,完全离线运行,是 CodeWatch 的兄弟项目。仓库含 OBD 数据、Home Assistant 集成、固件研究、systemd 服务等,共 270 次提交。讨论中有人问 Qwen 模型是否适合该任务,指出它只有 3B 激活参数,并质疑 Gemma 4 E4B 是否更实用。
-
Agentic上下文管理:记忆与成本作为架构问题
arXiv 论文提出 Agentic Context Management(ACM)概念,主张把 agent 的记忆与成本问题当作生命周期和架构问题处理,而非单纯的存储-检索。作者认为生产环境 agent 的失败多源于无法管理推理上下文(对话历史、大 prompt、工具定义与输出膨胀),并分解出五个原语:architecting、ingesting、scoping、anticipating、compacting & consolidation。经济性论证指出朴素上下文累积使 token 成本随对话长度二次方增长,粗粒度摘要虽线性成本但带来准确率悬崖,只有验证过的压缩能在线性成本下保持保真度。参考实现 Maximem Synap 作为多租户服务,在 LongMemEval 上报告 92%、LoCoMo 上 93.2%。讨论中有人称 ACM 正是自己寻找的术语,认为多数 LLM 问题本质是 context 问题,压缩验证与预测性获取是方向;也有人询问 Synap 是否支持文档类上下文、在大数据集上是否优于 RAG、以及 on-prem 选项。