共绩算力上的国产大模型,我们自己也跑了一遍
国产大模型越来越多,选型成了开发者的麻烦事。既然咱们把 DeepSeek、Kimi、GLM 这些主流模型都接进平台了,干脆自己拿同一套题跑一遍,7 个模型拉出来溜溜,看看到底谁好用。不吹不黑,结果先放下面。 测了什么 我挨个点了一遍,共有 7 个国产顶尖模型: - DeepSeek V4 Flash...
探索前沿技术,分享实践经验,追踪行业动态
01 引言:一张牌拍在桌上 2026 年 7 月 16 日,世界人工智能大会开幕前一天,月之暗面把一张牌拍在了桌上——Kimi K3。2.8 万亿参数,全球首个开源 3T 级模型,权重承诺 7 月 27 日前完全开放。消息一出,Hacker News 的讨论帖冲上 1023 分、630 条评论,海...
01 引言:一张牌拍在桌上 2026 年 7 月 16 日,世界人工智能大会开幕前一天,月之暗面把一张牌拍在了桌上——Kimi K3。2.8 万亿参数,全球首个开源 3T 级模型,权重承诺 7 月 27 日前完全开放。消息一出,Hacker News 的讨论帖冲上 1023 分、630 条评论,海...
很多团队把 Agent 从 demo 搬上生产,第一道坎不是模型效果,是基础设施。demo 里跑通一次不代表能天天跑。我们帮不少团队踩过这个坑,缺的往往是几个基础设置。 超时:别让一个慢接口拖死整条链 Agent 调一个工具,对方没反应,不能无限等。每个调用得有超时,到了时间要么换路要么报错。我们见...
我们帮客户组多节点训练集群,常被一个误解绊住。客户说,给我八张卡,我要八倍的算力。我们说,八张卡给你了,但你大概率拿不到八倍。 多卡不是简单的加法。卡与卡之间要通信,要同步梯度,要抢同一块内存和带宽。这些开销不处理,八张卡可能只给你四倍,甚至更糟,卡越多互相拖累越明显。我们见过一个客户,八卡训练速度...
我们管着一堆来源不同的资源,机器来自不同渠道,状态分散在各家的接口后面。最早和很多团队一样,用定时任务去各家轮询,把结果拉回来比对。资源少的时候十分钟问一次,勉强够用。 1.轮询越走越重 后来发现这条路走不动。轮询频率低了,状态滞后,用户看到的和真实情况对不上,他以为机器还活着,其实早被回收了,提交...
做 Serverless GPU 的团队迟早要面对一个问题。函数平时缩到零,来请求了再起机器。从零到能干活,中间那段等待就是冷启动。 延迟分两层,常被混为一谈 用户感受到的延迟分两层。一层是平台把容器拉起来、把模型权重加载进显存的时间,这部分平台能优化。另一层是物理上的硬约束,模型越大,往显存里搬的...
我们和不少做 Agent 的团队聊过,共识越来越清楚。Agent 跑起来的负载形状和单次模型调用完全两回事。 单次推理是平的,Agent 是 burst 单次推理是一个请求进来,跑完,出去,流量能画成一条平稳的线,配资源照着平均来就行。Agent 不是。它先规划,再循环,中途可能并行调一堆工具,某个...
时间来到 2026 年年中,世界模型 (World Model) 依然是 AI 领域最受关注的方向之一。刚刚过去的六月格外热闹:海外这边,一家创业公司完成了大额融资、英伟达开源了新一代世界基础模型;国内这边,阿里和昆仑万维也几乎同期亮出了自己的具身与世界模型成果。把这些事拼在一起,透露出一个比模型本...
最近世界模型有多火,不用我多说了。李飞飞下场创业,Google 的 Genie 把实时交互世界玩出花,国内 Matrix-Game 这类开源项目一个接一个。我自己在公司是干什么的呢,研究模型部署镜像的。最近打的全是世界模型,打到手软。打包的间隙,我突然冒出一个念头:这波热潮,源头到底在哪?于是我顺着...
--- 一、第一性原理:世界模型和 LLM 到底差在哪 搜索"世界模型",会看到一长串互相矛盾的定义:有人说它是视频生成模型,有人说它是自动驾驶仿真器,有人把它和 AGI 划等号,有人觉得它是新瓶装旧酒。我们先把它的边界划清楚。 一句话定义:世界模型是给定"当前观测 + 即将执行的动作",预测"下一...
6 月 4 日,李飞飞和 World Labs 团队发了一篇新文章。 开头第一句话就很狠: "The world is not made of words."(世界不是由词语构成的。) 这是去年 11 月那篇《From Words to Worlds》的续篇。上一篇讲的是"空间智能是 AI 的下一个...
半个月前,Richard Sutton——强化学习的那个 Sutton,2024 年图灵奖得主——和 Banafsheh Rafiee 合写挂了一篇论文,《Toward Enactive Artificial Intelligence》(arXiv 2605.24238,5 月 22 日)。没有模...
信号 1:中国 AI 视频生成完成"从模型秀到工作流嵌入"的跃迁 2024-2025 年,可灵、Sora、Runway、Pika 还在"卷参数、卷 demo、卷哪个生成的 5 秒镜头最像样"。2026 年的关键词变了:工作流嵌入。 可灵这次戛纳发布的措辞很微妙——"AI is entering r...
> 一个 Agent 跟你说"任务完成"的时候,你信吗? > 当一个 LLM 评测榜单上某个 Agent 拿了 85 分,你想过它可能"三次里只成功一次"吗? > Claw-Eval 是 ModelScope 团队新开源的端到端 Agent 评测框架,300 个人工验证任务,从完成度、安全性、鲁棒性...
「技能」(skill)正在成为 Agent 系统里一个越来越关键的抽象:它把能力从庞大的模型权重里解耦出来,封装成可执行的代码、操作流程或领域指令,让 Agent 能像搭积木一样组合调用。逻辑上,这是 Agent 持续变强的天然路径——它应该能自己造技能、自己存、自己挑、自己改,而不必每一步都等人来...
大学毕业之后,想凑齐八到十二个人打一局完整的狼人杀,几乎成了奢侈。可这游戏真正迷人的地方,从来不只是社交本身——而是那套逻辑推演、话术博弈,以及在只言片语里反复确认谁在说谎的过程。 Wolfcha 想还原的,正是后面这部分。 它的设定很简单:一桌人里只有你是真人,其余七到十一个座位,全部交给大语言模...
2026 年 5 月,OpenAI 宣布它的一个内部模型,反驳了离散几何领域一个悬置了近 80 年的猜想。 这个问题本身简单得惊人。1946 年,数学家 Erdős 提出了"单位距离问题":在平面上放 n 个点,最多能有多少对点之间的距离恰好等于 1?近 80 年里,数学界普遍相信,规整的方形网格...