量子位

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

6.7内容质量

TL;DR · AI 摘要

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉 – 量子位 扫码关注量子位 <div class="top search" <form role="search" method="get" class="search-for...

核心要点

  • 主题聚焦:GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
  • 来源:量子位,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#后端#开源
打开原文

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉 – 量子位

扫码关注量子位

<div class="top_search"> <form role="search" method="get" class="search-form" action="https://www.qbitai.com/" id="search"> <label> <input type="search" class="search-field" placeholder="搜索…" value="" name="s"> </label> <button type="submit" class="search-submit"></button> </form> </div>

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

articlead begin

articlead end

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

鹭羽

2026-06-30

16:46:19

来源:

量子位

摘要样式

真·有求必应·阿拉丁

鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI

最近,清华教授、智谱灵魂人物 唐杰 聊得有点high。

昨天先是畅聊AI认知,“AI的终局就是AGI,一场猎龙游戏”。引起广泛热议后,一觉醒来今天又在当众征集意见:

各位! 下个版本 的GLM,你想要啥?

浏览量瞬间干到了 40w+ ,这影响力真够顶的!

不过要说网友们为啥这么捧场,还得倒回去年GLM-4.6刚开源那会儿。

彼时唐杰也问过这么一回,评论区纷纷热情支招,一条条需求后来陆陆续续都在GLM后续版本中有所实现。

真·有求必应·阿拉丁。

所以这次他一张口,懂行的人立马团建去了~有po自己痛点的,也有智谱自家员工在下面留言。

比如这位网友直接列出了自己的愿望清单:更强的Agent能力、超长上下文保持质量、更灵活的API……

更有甚者诚恳祈祷:求你了GLM!做一个类似Codex的桌面应用!!

有趣的是,这次GLM-5.3的评论区,刷得最多的还是——

视觉!

GLM的视觉之痛

两周前,智谱刚刚开源 GLM-5.2 。

强到离谱!开源界AI编程第一、全球第二,仅屈居于大名鼎鼎的神话级模型Fable-5。

但要说痛点,很明显,也是真的痛:

没视觉啊……

纯文本模型 ,搞得动百万Token超长上下文和深度逻辑推理,但偏偏没搭载视觉编码器,看不了图也造不出图。

反观拿来对标的Fable-5,它是原生多模态模型,视觉能力应有尽有。

于是GLM用户双双流下羡慕的泪水:我也想拥有TT

而且关键在于, 不是智谱做不出视觉 。恰恰相反,今年4月智谱发过一个叫GLM-5V-Turbo的模型。

原生多模态的Coding基座,从预训练阶段就把视觉和文本揉在一起,能看懂设计稿、截图、网页界面,然后直接吐出能跑的代码,主打视觉+代码+Agent一体化。

再往前看,智谱也做过不少多模态模型, CogVLM 视觉编码器就出自他们之手。唐杰本人发表过的视觉论文,更是一抓一大把。

所以问题压根不是有没有视觉能力,而是智谱没把视觉放进最强旗舰模型中去。

这一点从唐杰过往的发言中也可见一斑,比如去年底的大模型年终总结,他先是肯定 多模态是未来 。

但随即他又补刀道:

问题是,当下的多模态对提升AGI的智能上界,帮助有限。可能最有效的方式还是 分开发展 ,文本、多模态、多模态生成。当然适度的探索这三者的结合肯定能发现一些很不一样的能力,但这需要勇气和雄厚的资本支持。

你品,你细品。

唐杰这种冲在AI一线的科学家,盯着的始终还是第一性原理—— 模型智能 。视觉可以让模型更好用,但要让模型更聪明,靠的还是复杂推理那套硬功夫。

这就是用户和厂商的视角差异。

AGI对于用户太遥远了,所以用户更在乎的是,眼下贴张图模型能不能接住、截个屏模型能不能看懂。

于是就出现了这条推文里最微妙的拉扯。一边是科学家盯着智能的天花板,觉得视觉只是锦上添花;一边是全世界的开发者都在齐刷刷呼喊视觉。

更何况, 对手也来势汹汹 。

Kimi K2.5今年1月就是原生多模态了,Qwen3.5-Omni三月份端到端把文本/图像/音频/视频全统一进一个模型,更别说国际上Gemini 3那种原生文图音视频一把抓的。

GLM旗舰款补足视觉,几乎是迫在眉睫。且等接下来端上桌的 GLM-5.3 。

One More Thing

最后再看看唐杰最近的一些分享吧,还挺值得琢磨的。

(其一)

(其二)

(其三)

(其四)

参考链接: [1] https://x.com/jietang/status/2071454597521215748?s=20 [2] https://x.com/ZixuanLi_/status/2071491673511674059?s=20 [3] https://m.weibo.cn/status/5247011059141988

版权声明

版权所有,未经授权不得以任何形式转载及使用,违者必究。

GLM

智谱

作者文章列表

  • 4秒出百万面!突破千万面精度+12K高清贴图,手握数亿的3D生成公司下一局怎么打? 2026-06-25
  • 哈?Q1狂烧250亿!OpenAI财报泄露全网炸锅 2026-06-18
  • HuggingFace CEO力荐,Bengio团队也押注:这个1500美元训出的HRM模型,凭什么火了? 2026-06-13
  • 仅4B大小可端侧部署!卡帕西预言的「认知模型」被国产做出来了 2026-06-09

左侧分享

扫码分享至朋友圈

相关阅读 start

相关阅读

#### 智谱GLM-5技术全公开!完全适配华为等国产芯片,美国网友酸了

引入DeepSeek同款机制

梦晨

2026-02-23

#### 今天起,国产AI可以像人一样用手机了!一手实测在此

电脑网页也能“自动驾驶”

十三

2024-10-26

AutoGLM

人工智能

#### 智谱唐杰:成功企业靠管理那是曾经,AI时代不行了

AI时代:认知>格局>技术>管理。

衡宇

AI时代

唐杰

#### 抢跑GPT-5,智谱开源新SOTA模型,一句话搞出能看视频、发弹幕的B站!

首次在一个模型里融合推理、代码和Agent

2025-07-29

GLM-4.5

大模型

开源

#### 杭州在六小龙之后,又开始投资北京六小虎了

超10亿元融资

2025-03-03

北京

杭州

融资

#### GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

前两天的热度还是保守了

2026-02-14

GLM-5

开源AI

相关阅读 end

热门文章 start

热门文章

#### WAVES 2026:今年盛夏,在创投浪潮里,做迎风而立的少数人!

2026-06-26

#### Claude Fable 5分批重新上线!GPT-5.6秒跟

#### 从需求到设计到代码,一个软件全搞定!TRAE Work Design实测来了

#### 谷歌「推理之王」也跑路Meta了,当年还是李飞飞挖来的

#### 科大讯飞发布企业服务Claw平台:一句话搞定需求到方案全流程

2026-06-25

<form role="search" method="get" class="search-form" action="https://www.qbitai.com/"> <label> <span class="screen-reader-text">搜索:</span> <input type="search" class="search-field" placeholder="搜索…" value="" name="s" /> </label> <button type="submit" class="search-submit"><span class="screen-reader-text">搜索</span></button> </form>

热门文章 end

底部版权

  • 关于量子位
  • 加入我们
  • 寻求报道
  • 商务合作

<a href="/?page_id=183"target="_blank"><i class="weixin_icon"></i></a>

追踪人工智能新趋势,报道科技行业新突破

<p>量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1</p>

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1