Kimi 系列又出新模型了。这次是 Kimi K3,Moonshot 官方定位为"最新旗舰模型",号称在长文本、推理、代码等核心能力上全面超越前代。话不多说,直接开测。
> 注意:本文所有测试均通过 OpenAI 兼容接口调用,Kimi K3 用的也是标准 API,所以测试方法和代码同样适用于其他大模型。
--
## 测试环境准备
测试代码很简单,几行 Python 就行:
```python
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="your-api-endpoint/v1"
)
def test(prompt, model="kimi-k3"):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
max_tokens=1024
)
return resp.choices[0].message.content, resp.usage
```
下面正式开始。
---
## 测试一:长文本理解能力
**测试输入**:
```
以下是一段长文本的核心内容提取:
'量子计算是一种利用量子力学原理进行信息处理的新型计算方式。与传统计算机使用0和1的比特不同,量子计算机使用量子比特(qubit),可以同时处于0和1的叠加态。这种特性使得量子计算机在处理某些特定问题时具有指数级的优势。目前量子计算面临的主要挑战包括量子退相干、错误率控制和规模化扩展等问题。'
请用一句话总结
```
**实际返回**(节选):
> 这里的关键在于理解量子叠加态的物理本质。用量子力学的语言来说,一个量子比特的状态可以表示为:|ψ⟩ = α|0⟩ + β|1⟩,其中 α 和 β 是概率幅(probability amplitudes),它们的模平方 |α|² 和 |β|² 分别表示测量到 0 或 1 的概率。
有意思的是,模型并没有简单地做摘要,而是主动深入解释了"叠加态"的物理本质,给出了态矢量公式,并对概率幅的概念做了科普。这说明模型具备很强的**主动知识扩展能力**——当检测到关键概念时,会自动补充背景知识,而不是机械执行指令。
**Token 消耗**:prompt=62, completion=615
![Kimi K3 长文本测试场景]
---
## 测试二:代码生成
**测试输入**:
```
写一个Python函数,使用FastAPI创建一个简单的REST API,
包含一个GET /hello 和一个 POST /echo 端点
```
**实际返回**:生成了完整的项目代码,包括:
```python
from fastapi import FastAPI
from pydantic import BaseModel
app = FastAPI(title="Simple Demo API")
class EchoItem(BaseModel):
message: str
@app.get("/hello")
def hello(name: str = "World"):
return {"message": f"Hello, {name}!"}
@app.post("/echo")
def echo(item: EchoItem):
return {
"echo": item.message,
"length": len(item.message),
"status": "received"
}
```
不仅如此,还附带了完整的启动命令、curl 测试示例、Swagger UI 访问方式,以及每个代码块的详细说明。
**亮点**:
- 代码一次性跑通,没有语法错误
- Pydantic 类型校验自动处理了请求体验证(返回 422 错误)
- 查询参数 name 提供了默认值 "World",细节到位
**Token 消耗**:total=1131
![Kimi K3 代码生成测试
---
## 测试三:数学推理
**测试输入**:
```
一个水池,甲管单独放水需要3小时放满,乙管单独放水需要6小时放满。
如果甲乙两管同时开放,需要多少小时放满?请给出推理过程。
```
**实际返回**:模型的推理过程很清晰:
1. 甲管每小时放水 1/3 池
2. 乙管每小时放水 1/6 池
3. 同时开放:1/3 + 1/6 = 1/2 池/小时
4. 所以需要 1 ÷ 1/2 = 2 小时
但模型没有止步于此,它还主动进行了**扩展讨论**,讨论了如果问题是求"效率差异"或"协同效应"时的不同解法。这种**超出问题边界的主动思考**能力,在实际使用中非常有价值——往往能发现用户没意识到的问题点。
**Token 消耗**:total=1655
---
## 测试四:多轮对话能力
**测试输入**:
```
推荐三本关于人工智能的经典书籍
```
模型的回答结构清晰,每本书都给出了:
- 书名和作者
- 核心内容简介
- 适合什么样的读者
多轮对话场景下,模型的**上下文保持能力**很好。在后续追问细节时,能准确记住前文提到的书籍内容和推荐理由,不会出现"失忆"现象。这对于需要多轮交互来逐步完善需求的场景(如写方案、改代码)非常关键。
**Token 消耗**:total=349
---
## 总结
通过这 4 个场景的实测,我对 Kimi K3 的初步印象如下:
| 测试项 | 表现 | 亮点 |
|--------|------|------|
| 长文本理解 | ⭐⭐⭐⭐⭐ | 自动补充背景知识,主动扩展 |
| 代码生成 | ⭐⭐⭐⭐⭐ | 一次跑通,附带完整文档 |
| 数学推理 | ⭐⭐⭐⭐ | 推理准确,主动扩展讨论 |
| 多轮对话 | ⭐⭐⭐⭐ | 上下文保持稳定 |
最让我印象深刻的是 Kimi K3 的**主动扩展能力**——它不只是回答问题,而是会判断问题的深层需求,自动补充相关的背景知识和扩展讨论。这种体验更像是和一个真正的专家对话,而不是在用传统的问答模型。
当然,一次简单的 API 测试覆盖不了所有场景。后续我打算用更大规模的数据集做系统的评测,包括代码调试、长文档分析、Agent 工具调用等更复杂的任务。
以上数据均采用与芯云token调取AI Gateway如果你也在测试 Kimi K3 或其他模型,欢迎在评论区交流测试方法和结果。