AI指南

探索最全面的AI指南,涵盖人工智能基础知识、实用工具、学习资源和最新趋势,助您快速掌握AI技术并应用于实际场景。

Token 不是计费单位,是智力经济的新蒲式耳

Token 不是计费单位,是智力经济的新蒲式耳

打开任何一家模型厂商的定价页,你都会看到同一个词:每百万 Token 多少美元。大多数人把它当成一条计费规则,一个成本项,财务报表里待压缩的一行。这个理解太窄了。 本文的论点只有一个:Token 是人类历史上第一个可以按量购买、精确计量的「智力产出」单位。这不是定价技术问题,而是一个经济结构问题——因为所有围绕它的直觉,都建立在为石油、电力、带宽设计的旧框架上,而这些框架在 Token 面前会系统性地失灵。 一 …

阅读更多 →
Jev 实战上手指南:一个不做生成的 AI 怎么用出真价值

Jev 实战上手指南:一个不做生成的 AI 怎么用出真价值

一、它到底是什么:先纠正一个预期 2026 年 9 月中旬,TypeSafe 发布了一个叫 Jev 的 System One Model。名字里的「系统一」借自心理学:它不写文章、不写代码、不生成任何文本,只做一件事——快速给出判断。 传统 LLM 是系统二:慢、贵、擅长推理。Jev 是反过来的:快、便宜、擅长直觉式分类和评分。官方给的对比例子是单次决策 0.000081 美元、0.114 秒完成,对比典型 LLM 的 0.01388 美元、8.566 秒——成本差两个数量级 …

阅读更多 →
Jev 选型指南:什么样的判断该交给它,什么样的不该

Jev 选型指南:什么样的判断该交给它,什么样的不该

先说结论 如果你的产品里有一类决策,答案永远只能从几个有限的选项里挑一个——紧急还是不紧急、走哪个队列、放行还是拦截——那 Jev 值得你现在就看一眼。反过来,如果答案需要模型「想出来」,比如写一段回复、规划一个方案,那它跟你没关系。 一句话概括:Jev 是一个不做文本生成的判断引擎。你给它一份状态数据和一组问题,它还你一个选项、一个概率分布和一个置信度,全程没有一句话是它「写」出来的。 这个思路来自 Ty …

阅读更多 →
Harness 比模型更重要:AI Agent 竞争的真正变量已经换位

Harness 比模型更重要:AI Agent 竞争的真正变量已经换位

副标题:当六个前沿模型在基准上只差 0.8 分,决定成败的不再是权重,而是包裹权重的那个系统。 破题 一个流传极广的假设是:Agent 的能力上限由模型决定。想要更强的自动化?等下一次模型发布。 2026 年的数据把这个假设拆穿了。SWE-bench Verified 上,六个最强的前沿模型——Claude Opus 4.5/4.6、Gemini 3.1 Pro、MiniMax M2.5、GPT-5.4、Sonnet 4.6——的成绩全部挤在 79.6% 到 80.9% 之间,最大差距 0.8 分。这不是接近 …

阅读更多 →
Harness 决定你能走多远:同一模型为何差出 36 个百分点

Harness 决定你能走多远:同一模型为何差出 36 个百分点

同一个模型,两次考试,差出 36 个百分点 9 月 3 日,ARC Prize 公布了 ARC-AGI-3 的一组新成绩:同一个模型 GPT-6 Astra,同样的推理强度,放进两套不同的 Harness,得分一个是 62.7%,一个是 98.6%。 更反直觉的是成本:得分更高的那一组,花费反而从约 2.61 万美元降到 1.73 万美元,降了约 34%。 大脑没换,只是换了工作方式,Agent 几乎变成了另一个水平。 几天后,YC 专门办了一场 Paper Club,主题就叫《Why the H …

阅读更多 →
办公智能体进入「分级」时代:Grade Agentic Worker 全球格局观察

办公智能体进入「分级」时代:Grade Agentic Worker 全球格局观察

流行假设是:办公智能体是一类同质产品,选哪个只是品牌偏好——Copilot、Gemini、Manus、Genspark,功能大同小异,价格都在 20 美元上下。 这个假设站不住脚。2026 年的办公智能体市场已经出现了清晰的分层:它们不是同一产品的不同品牌,而是三种不同的「工人等级」——坐在你身边的实习生、驻场的部门员工、和外包的远程团队。选型的本质不是「哪个好用」,而是「你愿意把哪一级工作交给哪一级工人」。 我们把这套判断框架 …

阅读更多 →
用 FreeToken 在 RTX 4060 上跑 35B 大模型:边缘 MoE 推理实战

用 FreeToken 在 RTX 4060 上跑 35B 大模型:边缘 MoE 推理实战

伯克利与 MIT 团队开源了 FreeToken:一款面向消费级硬件的 MoE 推理引擎,能在 8GB 显存的 RTX 4060 笔记本上跑 Qwen3.6-35B,解码速度约每秒 39 Token。它把个人电脑当作可弹性调度的异构算力,而不是资源受限的“小数据中心节点”。对想摆脱云 API、本地跑大模型的开发者来说,这是很值得动手的路线。 核心思路:别让 GPU 停下来 稀疏 MoE 模型每个 Token 只计算全部参数的一小部分,但解码时仍要在数千亿未激活权重之间 …

阅读更多 →
只强化机器人真正执行的动作:SmoothRL 异步在线强化学习拆解

只强化机器人真正执行的动作:SmoothRL 异步在线强化学习拆解

机器人基础模型越做越大,推理也越来越慢。真实部署为了不掉帧,普遍改用异步推理:机器人在执行当前动作段(action chunk)的同时,模型在后台算下一段。控制是流畅了,但这也悄悄破坏了在线强化学习。 问题在于:异步执行下,模型「计划的」动作和机器人「真正做的」动作不再一致。新 chunk 算好时,机器人已经走完了旧指令的一部分;新 chunk 还没执行完,下一轮推理结果又来覆盖它的后半段。如果对整段动作统一做梯度 …

阅读更多 →
英伟达官方推理指南:投机解码如何让模型贴着硬件极限设计

英伟达官方推理指南:投机解码如何让模型贴着硬件极限设计

9月2日,英伟达技术博客上线了一篇官方推理指南,主题是「用投机解码做AI模型协同设计」。芯片霸主罕见地以官方姿态,把「模型该怎么贴着硬件物理极限去设计」写成了规范。核心是一张6种主流推理加速方案的选型表,外加一条硬性约束公式——你的注意力分组数,直接决定草稿该猜几个token。 投机解码在干嘛 大模型逐字吐字,每吐一个词,几百GB参数就得在显存里完整跑一圈,大部分算力都在等内存搬数据。投机解码的解法很粗 …

阅读更多 →
用强化学习训练双脚机器人:Microduck 上手指南

用强化学习训练双脚机器人:Microduck 上手指南

Microduck 是 Pollen Robotics(Hugging Face)推出的 25 厘米、约 800 克的开源双足机器人,出厂自带 7 个预训练动作——走路、坐下、踢球、用喙抓取、滑旱冰、倒地后站起来。对开发者来说,亮点不在萌,而在它整套软件栈以 Apache-2.0 协议开源在 GitHub 上:你可以自己用强化学习在物理仿真里训练新步态,再把学到的策略直接部署到实体机器人上。 为什么值得关注 多数强化学习 demo 止步于仿真。Microduck 闭环了:MuJoC …

阅读更多 →
Archify 实操:把代码仓库一键变成交互式架构图

Archify 实操:把代码仓库一键变成交互式架构图

Archify 是一个开源的 Agent Skill,一句话就能把代码仓库或系统描述变成可交互、可校验的架构图 HTML,兼容 Claude Code、Cursor、Codex 与 OpenCode,一条命令即可安装。

阅读更多 →
HCPD 实操:只用问答对就抓大模型幻觉,AUROC 88% 全开源

HCPD 实操:只用问答对就抓大模型幻觉,AUROC 88% 全开源

ICML 2026 的零源幻觉检测方案 HCPD:只看问答对文本即可判定可信度,不需要模型内部状态或知识库,LLaMA-3.1-8B 上 AUROC 88.19%、Qwen3-8B 上 89.62%,附完整复现命令与实践建议。

阅读更多 →
滚动至顶部