ChatGPT 在本站五维评测口径下总分 3.6:核心能力与生态集成都是 4.50,但可用性仅 2.25、输出质量 3.80。本文逐项给出打分依据,并说明为什么「需科学上网 + 只收境外卡」会实打实影响总分。
ChatGPT 好用吗:能力面最宽的一款,但境内可用性把它压到 3.6
先说结论
ChatGPT在本站的五维评测口径下总分 3.6(评测日期 2026-09-28)。这句话要分开说:它的核心能力与生态集成都是 4.50,是本批并列最高的两项,但可用性只有 2.25 —— OpenAI 不向中国大陆提供账号与服务,注册需要海外手机号或邮箱,订阅以美元计价需境外支付方式。
- 适合:网络条件与支付方式都不成问题的用户;希望一个入口覆盖写作、翻译、编程、数据分析、图像生成的场景;需要自定义助手与项目空间把流程固化下来的人;以及需要语音对话与读图的移动端场景。
- 不适合:境内无法稳定访问的环境;涉及合规约束、不能把数据上传到境外的项目;以及对免费档能力边界稳定性要求高的场景(模型与额度调整频繁)。
如果你的实际条件让它连不上,那么 4.50 的能力分对你等于零——这正是本站把可用性放进评分体系、且给到 25% 权重的原因。
评测口径
对话类的五维权重与代码类不同:核心能力提权到 35%,因为对话类工具之间的能力差距远大于价格差距。
| 维度 | 权重 | 本条得分 | 依据来源 |
|---|---|---|---|
| 可用性 | 25% | 2.25 | 站内 availability:需科学上网、界面有简体中文、注册需海外手机号、订阅美元计价需境外支付 |
| 核心能力 | 35% | 4.50 | 站内 features / pros 人工分档 |
| 成本效率 | 15% | 3.00 | 站内 availability + pricing:有免费档,但需境外支付 |
| 生态集成 | 15% | 4.50 | 站内 pros / features 人工分档 |
| 输出质量 | 10% | 3.80 | 站内 cons 人工分档 |
这份评测做了什么:把站内已核实的功能清单、优缺点与可用性事实,逐条落到五个维度上,给出可追溯的分数。
这份评测没做什么:不跑通用基准,不编造第一人称实测,不引用第三方跑分排名。价格与可用模型调整频繁,具体档位与权益以官网当期页面为准,文中不写死金额。
逐项打分
可用性(2.25 分 · 权重 25%)
这是它的失分项,也是总分被压到 3.6 的主要原因。大陆网络需科学上网——OpenAI 不向中国大陆提供账号与服务;界面语言有简体中文、中文问答与写作质量可用(故有加分);注册需要海外手机号或邮箱,大陆号码无法通过验证;付费订阅以美元计价,需境外信用卡或应用商店代扣。另外数据存储于境外,且对话默认可能用于模型训练(可在设置里关闭),受合规约束的项目需要先评估。
核心能力(4.50 分 · 权重 35%)
本批并列最高。一个入口覆盖多类任务:通用对话与写作(润色、改写、扩写、纪要、邮件、方案初稿)、文件解析与长文处理(上传 PDF、Word、表格后直接提问与交叉比对)、数据分析与图表(在对话里执行代码做统计与可视化)、联网检索(读取网页并给出带来源的回答)、图像生成与识别、代码编写与调试、语音对话。这些能力可按需开启,不是固定在一种问答形态。扣分在于模型与额度调整频繁,免费档的能力边界不稳定。
成本效率(3.00 分 · 权重 15%)
有免费档但功能与额度受限,完整能力需订阅;订阅以美元计价且需境外支付。有免费档加 1 分、需境外支付减 1 分,落在 3.00。也就是说它不是「贵」,而是付费这条路本身对境内用户不通——这和有免费档且支付可达的 DeepSeek、Kimi(均为 4.00)是两种性质的问题。
生态集成(4.50 分 · 权重 15%)
本批并列最高。第三方集成与自定义助手生态成熟,容易嵌进既有工作流;自定义助手与项目空间可以把固定角色、知识文件、常用指令固化成可复用的配置,不必每次重新交代背景。这是它相对 Claude(4.00)最明确的差距所在——后者自己也写明第三方生态与插件数量不及 ChatGPT。
输出质量(3.80 分 · 权重 10%)
本批最低。能力面宽不等于产出可靠:站内记录的缺点写得很明确——答案会出错,而且出错时语气同样笃定,事实性内容必须逐条核对;敏感数据不能上传,也限制了它在合规要求高的场景里的使用。这一维它低于 Perplexity(4.10)的原因就在这里:后者每条结论都带来源链接,从机制上降低了凭空生成。
同类对比
| 维度 | ChatGPT | DeepSeek | Kimi | Claude | Perplexity |
|---|---|---|---|---|---|
| 总分 | 3.6 | 4.4 | 4.3 | 3.5 | 3.6 |
| 可用性 | 2.25 | 5.00 | 5.00 | 2.00 | 2.25 |
| 核心能力 | 4.50 | 4.30 | 4.10 | 4.40 | 4.50 |
| 成本效率 | 3.00 | 4.00 | 4.00 | 3.00 | 3.00 |
| 生态集成 | 4.50 | 4.50 | 3.80 | 4.00 | 4.20 |
| 输出质量 | 3.80 | 4.00 | 4.00 | 3.90 | 4.10 |
这张表把本站评分的设计意图说明白了:ChatGPT 在能力与生态两维全面领先,总分却与 Perplexity 持平、低于 DeepSeek 与 Kimi,因为可用性是乘法关系里的那个零——用不上的能力不计分。反过来,如果你的网络与支付条件都不成问题,那么对你而言真正可比的就只有能力维,ChatGPT 会是更合适的选择。
常见问题
境内就完全用不了吗?
按站内记录的口径:OpenAI 不向中国大陆提供账号与服务,大陆网络需科学上网,且大陆号码无法通过注册验证。也就是说不仅访问需要自备网络条件,注册这一关也需要海外手机号或邮箱。这不是「慢一点」,是「用不上」,选型时要按后者算。
免费版够不够用?
有免费档,但功能与额度受限,且模型与额度调整频繁、能力边界不稳定——习惯的用法可能突然变了。用来评估是否顺手是够的,若打算长期依赖某一项具体能力,建议先确认该能力在当前档位是否可用。
它比国产对话工具强在哪?
强在能力面与生态:写作、数据分析、图像生成、语音对话可以在同一个入口完成,且第三方集成与自定义助手生态成熟,容易嵌进既有工作流。国产工具在境内可用性、支付可达与合规部署上有结构性优势。这两类优势覆盖的是不同维度,不存在谁全面替代谁。
数据安全怎么评估?
数据存储于境外,且对话默认可能用于模型训练(可在设置里关闭),敏感数据不能上传。受合规约束的项目需要先评估;如果要求数据不出内网,DeepSeek 的开源本地部署才是满足条件的选项。
相关工具与内容
本文的分数来自本站评分体系 v1(评测日期 2026-09-28),口径与权重见 scripts/tools-rating.js,方法论见 docs/ai-tool-evaluation-v1.md。功能与价格以官方页面显示为准。
同批次的另外几篇评测:DeepSeek 评测、Kimi 评测、Claude 评测、Perplexity 评测。同类工具见AI 对话分类,也可对比智能搜索分类,完整清单见全部工具。
相关内容
Midjourney 3.1 分:画质没得说,卡在三道门槛
Midjourney 在本站五维评测口径下总分 3.1,是图像类三款里最低的——但输出质量 4.50 与核心能力 4.40 都是三者最高。分数卡在三道门槛上:需科学上网、无长期免费额度、订阅需境外支付。本文逐项给出依据,并说明什么条件下它仍是更合适的选择。
两分钟出一首完整歌:Suno 的 AI 音乐评测
Suno 在本站五维评测口径下总分 3.3,是音频类三款里最低的一款——但它的核心能力 4.30 是三者最高。分数是被可用性 2.00 拉下来的:官方服务未覆盖中国大陆,订阅需境外支付。本文给出逐项打分依据,并说明什么条件下它仍然值得用。
Canva可画 4.1 分:不会设计也能出图,别想精细控制
Canva可画 在本站五维评测口径下总分 4.1,与创客贴并列设计类第一梯队:门槛极低、模板覆盖面广、协作成熟,生态集成 4.30 是本批设计类最高。本文给出逐项打分依据,并说明它的边界在哪里——复杂构图与印刷级色彩管理做不到。