▸ 本页目录(6 节)

00 · 认知入门

模型认知课:多模态、视觉、能力与价格,一次搞懂

老师最容易被绕晕的一课,讲得最白话:什么是多模态、哪些模型能看图、能力强弱怎么看、倍率价格怎么算、在 WorkBuddy 里怎么选——附傻瓜实验。

WorkBuddy 实机货架(v5.4.5)/ 公开模型资料整理

一句话结论:模型没有全能冠军,只有「擅长什么、卖多少钱」。看懂三样东西——能力标签、倍率、自己的任务——选型就再也不迷糊。

先解决最常见的三个懵

懵点一:什么是「多模态」? 模 = 模式。文字是一种模态,图片、声音、视频各是一种。「多模态模型」= 能同时处理多种形式的模型。对你最实用的判断就一条:能不能看图

懵点二:哪些模型有视觉(能看图)? 三招,不用背:

  1. 看名字:名字里带「V」的通常有视觉,比如 GLM-V-Turbo 的 V 就是 Vision(视觉);
  2. 看货架标注:模型选择器里的说明会标注能力;
  3. 傻瓜验证法(最可靠):直接发一张图给它,问「这张图里有什么」——能描述出来就是有视觉。10 秒验证,比查资料快。

懵点三:能力强弱怎么看? 网上排行榜天天变,别背。记住三个实用的判断:

  • 倍率只决定这次任务扣多少积分,不决定你该不该用它——贵脑不是默认选项,是难题的备用弹药;
  • 新版本号 > 旧版本号:同一家的 K3 > K2.6、V4 > V3;
  • 自己的任务实测:把同一段话术发给两个模型,对比结果——这是唯一作数的评测。

货架速查:WorkBuddy 里的「脑子」都在这

模型能力×价格矩阵

这张表就是你在 WorkBuddy 模型选择器里看到的那排名字,按价格从低到高排好了:

  • 白嫖档(Hy4 / Hy3 限时免费):先拿它试所有活,九成日常任务它都够;
  • 性价比档(GLM-5.3-Flash 0.06x、Deepseek-V4-Flash 0.17x、MiniMax-M3 0.25x):批改式小任务、长文档总结、高频使用选这里;
  • 主力档(GLM-5.2/5.3、Kimi-K2.6/K2.7、Deepseek-V4-Pro):综合能力强,写正式材料、做分析;
  • 旗舰档(Kimi-K3 1.62x):写代码做网站、看图、有设计感的产出——贵有贵的道理。

模型迭代极快,表格里的倍率和能力以你打开货架那一刻为准——这张图教的是「怎么读货架」,不是让你背货架。

价格怎么算:一个公式

这次任务消耗 = 积分基准价 × 模型倍率 × 任务长度
  • 倍率在货架每行右边(0.06x ~ 1.62x);
  • 任务长度是大头:让它读 100 页材料、生成 20 页文档,消耗自然高;
  • 省钱三招:① 能用免费档先用免费档;② 长材料只发「需要的部分」;③ 复杂任务拆步骤,别一口气塞给它。

傻瓜实验:10 分钟建立你自己的模型判断力

做完这个实验,你对「该用哪个模型」就有手感了:

  1. 打开 WorkBuddy,选一个免费档模型,发送:
请用一句话介绍你自己:你的名字、开发者、能不能看图片、你最擅长什么。
  1. 点模型选择器,换成 Kimi-K3(贵档),发送同样的话;
  2. 对比两份回答的差别(细心的老师会发现:贵档的自我介绍更准确、更「自知」);
  3. 把实验结论记在备忘录里——这就是你自己的第一份「模型评测报告」。

进阶实验(可选):发一张课件截图给两个模型,问「这张图里的内容适合出什么考题」——有视觉的模型会描述图片内容,没有的会直接说它看不到。

检查点

  • 能说清「多模态」是什么、怎么 10 秒验证视觉
  • 打开模型货架,能读懂倍率和标签
  • 完成了两个模型的自我介绍对比实验

下一站

模型选好了,该让它真干活了 → 第 3 课 · 第一次干活;想深入「AI 是怎么写网页的」→ Vibe 101 · 解剖一个网页

返回 00 认知入门 · 课程列表