SpenseGPT Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
SpenseGPT 提出了一种实用的单次剪枝方法,优化了大语言模型推理中的稀疏和密集 GEMM 计算。
入选理由:SpenseGPT 通过单次剪枝实现稀疏和密集 GEMM 的优化。
人物
别名:@_akhaliq
推文发布者,VideoChat3的研究团队
已跟踪 30 条高相关材料
最近变化
2026-07-17 · VideoChat3是首个全开放的视频MLLM,支持高效视频理解
为什么值得关注
AK 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
SpenseGPT Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
AK(@_akhaliq) · 8.5 分
SpenseGPT 提出了一种实用的单次剪枝方法,优化了大语言模型推理中的稀疏和密集 GEMM 计算。
Seeing Isn't Knowing Do VLMs Know When Not to Answer Spatial Questions (and Why)?
AK(@_akhaliq) · 7.5 分
本文探讨视觉语言模型(VLMs)在面对空间问题时的局限性,指出其在缺乏明确视觉线索时可能错误自信地生成答案,并建议通过引入不确定性机制来提升模型的鲁棒性。
GPU Forecasters Language Models as Selective Surrogates for Kernel Runtime Optimization
AK(@_akhaliq) · 7.5 分
本文探讨了利用语言模型作为选择性代理进行 GPU 内核运行时优化的新方法,通过预测和选择最优内核配置,显著提升了性能。
已收录 30 条与 AK 相关的内容,按评分排序。
SpenseGPT 提出了一种实用的单次剪枝方法,优化了大语言模型推理中的稀疏和密集 GEMM 计算。
入选理由:SpenseGPT 通过单次剪枝实现稀疏和密集 GEMM 的优化。
This article explores a new approach to GPU kernel runtime optimization using language models as selective surrogates, achieving significant performance improvements by predicting and selecting optimal kernel configurations.
入选理由:语言模型被用作选择性代理,预测 GPU 内核的最佳配置。
This article explores the limitations of Visual Language Models (VLMs) in handling spatial questions, highlighting their tendency to confidently generate answers even when visual cues are ambiguous, and suggests introducing uncertainty mechanisms to improve model robustness.
入选理由:VLMs 在缺乏明确视觉线索时,仍可能自信地生成空间问题的答案。
LongMINT is a new benchmark testing framework for evaluating memory capabilities under multi-target interference in long-horizon agent systems, which has gained attention through academic sharing on Twitter. This framework specifically addresses memory interference issues in AI agents during long-term tasks and provides standardized testing methods for measuring continuous learning and memory management capabilities of agent systems.
入选理由:LongMINT是专门评估长视界智能体记忆干扰的新基准测试框架
Mix-Quant technology significantly improves the efficiency and precision balance of agentic LLMs through a hybrid strategy of quantized prefilling and precise decoding, providing new optimization directions for large model deployment.
入选理由:Mix-Quant采用量化预填充和精确解码的混合策略优化LLM性能
MulTaBench is a benchmark for evaluating multimodal tabular learning with text and image.
入选理由:MulTaBench 包含 12 个数据集和 3 种任务类型。
ESI-Bench is a novel benchmark focused on evaluating embodied spatial intelligence models in perception-action loops, offering more challenging scenarios and metrics than existing tests.
入选理由:ESI-Bench 采用连续 3D 轨迹预测任务,比现有基准更具挑战性
PhyMotion introduces a structured 3D motion reward mechanism grounded in physics to enhance the realism of human video generation.
入选理由:PhyMotion 引入物理约束以增强视频生成的真实性。
Research shows that a single neuron can bypass the safety alignment of large language models.
入选理由:单个神经元可破坏模型安全对齐
AK 在推特上分享了一种新的视频叙事生成方法 CausalCine,利用实时自回归生成技术。
入选理由:实时生成多镜头视频故事
VideoChat3是首个全开放的视频多模态大模型,支持高效通用视频理解,但技术细节披露有限。
入选理由:VideoChat3是首个全开放的视频MLLM,支持高效视频理解
ViQ 是一种文本对齐的视觉量化表示方法,可在任意分辨率下使用。
入选理由:ViQ 支持任意分辨率的视觉量化表示。
本文提出了一种基于置信度的工具编排方法,用于提升视频理解的鲁棒性,但内容较为简略,缺乏具体实现细节。
入选理由:置信度感知的工具编排方法可提升视频理解的鲁棒性。
LoopCoder-v2 是一种优化测试时计算效率的方法,通过减少循环次数提升性能。
入选理由:LoopCoder-v2 通过减少循环次数来提高测试时的计算效率。
文章分享了一篇关于LoopCoder-v2的论文,旨在提高测试时计算效率。
入选理由:LoopCoder-v2通过仅循环一次来提高测试时计算效率。
World Tracing 是一种生成像素对齐几何的新技术,但文章内容信息密度低,缺乏具体机制和实用价值。
入选理由:World Tracing 是一种生成像素对齐几何的新技术。
文章介绍了一种可扩展的3D交互轨迹世界模型μ_0,但内容信息密度低,缺乏具体技术细节和实用价值。
入选理由:文章提出了一种名为μ_0的3D交互轨迹世界模型。
CHORUS 是一种基于单一 VLA 策略的去中心化多实体协作方法,但文章内容信息密度低,缺乏具体机制和实践细节。
入选理由:CHORUS 采用单一 VLA 策略实现多实体协作。
文章分享了一篇关于SpenseGPT的论文,探讨了一种名为SpenseGPT的模型,旨在通过稀疏和密集GEMMs实现大语言模型的高效推理。
入选理由:SpenseGPT是一种通过稀疏和密集GEMMs实现高效推理的模型。
文章探讨了On-Policy Distillation的几何特性,但信息密度较低,缺乏具体实践指导。
入选理由:文章讨论了On-Policy Distillation的几何特性。
文章介绍了一种用于视频世界模型的潜在空间记忆方法,但信息密度较低,缺乏具体机制和实践指导。
入选理由:潜在空间记忆方法被提出用于视频世界模型。
文章介绍了一种名为DanceOPD的新方法,旨在通过On-Policy Generative Field Distillation提升强化学习的训练效率。
入选理由:DanceOPD是一种基于On-Policy Generative Field Distillation的强化学习方法。
文章介绍了一种名为 DomainShuttle 的文本到视频生成技术,但缺乏具体机制和深度分析。
入选理由:DomainShuttle 是一种文本到视频生成技术。
Wan-Streamer v0.1 是一个端到端的实时交互式基础模型,但文章内容缺乏具体技术细节和实用信息。
入选理由:文章标题提到 Wan-Streamer v0.1 是一个端到端的实时交互式基础模型。
文章内容信息密度低,缺乏技术深度和实用价值,主要为社交媒体上的链接分享。
入选理由:文章未提供具体技术细节或实用建议。
本文介绍了一个名为LOCUS的美国地方法规语料库,旨在通过开放数据促进法律研究和应用。
入选理由:LOCUS是一个包含美国地方法规的开放语料库。
文章内容信息密度低,缺乏具体技术细节和实用价值,仅提供了一个视频链接和社交媒体帖子。
入选理由:文章未提供具体技术内容或实用信息。
文章内容为推文形式,未提供具体技术细节或深度分析,信息密度低。
入选理由:文章未提供具体技术内容,仅包含论文链接和推文信息。
This tweet only provides a paper link without specific content, making it impossible to evaluate the actual value of the LongMINT framework in memory evaluation for long-horizon agents, with low information density.
入选理由:仅有论文标题LongMINT: Evaluating Memory under Multi-Target Interference提示研究方向
该推文内容信息密度低,未提供具体技术细节或实用价值。
入选理由:推文未提供具体技术细节