矩阵参数的奇异值熵越高越好吗?
奇异值熵并非越高越好;通过几何建模与平均场近似,发现最优熵值约为 log(n) - 1(n为矩阵维度),对应有效秩约 e·n,该值在自由度与表达能力间取得平衡。
入选理由:奇异值熵最大值为 log(n),但最优值约为 log(n) - 1,对应有效秩 ≈ e·n(e≈2.718)
概念
也叫:Adam优化器
2014年提出的经典优化算法
最近变化
2026-07-22 · Kimi Linear线性注意力机制全面超越传统注意力机制
Adam 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
矩阵参数的奇异值熵越高越好吗?
科学空间 · 9.2 分
Kimi founder and XLNet co-creator, Zhilin Yang: "Adam was invented in 2014, and now we have Muon Clip as a drop-in replacement. Attention was invented over eight years ago, and now we have Kimi Linear. Residual connections are now also challenged with attention residue." Three foundations of modern deep learning, all being replaced in the same generation of models. 39 minutes of pure insight from the architect behind Kimi, one of the most watched open models on earth right now. His team scaled Muon to o
God of Prompt(@godofprompt) · 8.5 分
Claude Code 的诞生 Anthropic 官方发布的一篇长篇口述史,记录了 Claude Code 从 2021 年的内部研究原型,到 2025 年 2 月正式发布,再到 2025 年冬全...
meng shao(@shao__meng) · 8.5 分
已收录 4 篇与「Adam」相关的 AI 资讯和分析。
奇异值熵并非越高越好;通过几何建模与平均场近似,发现最优熵值约为 log(n) - 1(n为矩阵维度),对应有效秩约 e·n,该值在自由度与表达能力间取得平衡。
入选理由:奇异值熵最大值为 log(n),但最优值约为 log(n) - 1,对应有效秩 ≈ e·n(e≈2.718)
Kimi模型团队在GTC keynote中展示了万亿参数模型、线性注意力机制和注意力残差技术,显著提升效率和性能。
入选理由:Kimi Linear线性注意力机制全面超越传统注意力机制
Claude Code 通过小团队敏捷开发、模型能力驱动产品形态、逐步让渡用户信任等策略实现突破,其诞生历程揭示了AI编码工具的演进逻辑。
入选理由:保持小团队可实现小时级热修复,用户反馈五分钟内响应
该视频为Hugging Face举办的AMA活动,邀请Modal公司代表Adam分享产品信息,内容以宣传和介绍为主,信息密度较低。
入选理由:Modal是一家提供基础设施服务的公司,支持AI开发。
与「Adam」经常一起出现的 AI 术语。
💡 想追踪「Adam」的长期趋势?去 实体雷达 · Adam 查看详细分析和跨材料问答。