591 房产 AI 估价优化 | 依据 2026-09-14 张总会议、2026-09-15 三方会议 | 制定日 2026-09-16
9 月 24 日(周四)完成初步试验与报告一句话:把估价流程里两个「人工插手」的环节做成两个开关,2×2=4 组,再加一组用 AI 自我迭代框架跑的,共 5 组,同一批数据、同一把尺子各跑一遍。
| 目标 | 误差率从现在的 10% 往 6%–8% 压,做到业内第一 |
|---|---|
| 这两周要的 | 不是达成 6%–8%,而是拿到排序——证明 AI 自主到底有没有帮助,并排除不可行方向 |
| 数据范围 | 15 年,成交约 160 万笔(每年约 10 万笔) |
| 交付物 | 5 组对比报告:误差率排序 + 耗时成本 |
每个开关都对应一个待回答的问题。「是」那一侧=今天线上的做法。
我们替 AI 算好的那些汇总数字,是帮忙还是帮倒忙?
交付形态是几份数据源表 + 关联键,不是一张大宽表;关联关系由数据组给,不让 AI 自己拼。
风险:原始版按物件关联后会膨胀,最坏是 N×N,量级须先评估。
让 AI 自己想办法,比我们现有这套流程更好吗?
这个开关已经把原来的「AI 定模型」和「专家系统」合并了——不给规则就等于拿掉专家系统。
本阶段不考核可解释性,只看精度;可解释性留到选型阶段再谈。
A 是今天的做法(已有结果),D 是全放手,E 与 D 同样全放手但换一条实现路径。B、C 各只拨一个开关,所以差多少就是那一个环节值多少。
| 组 | 数据处理 | 干预方式 | 这组代表什么 | 状态 |
|---|---|---|---|---|
| A ★ | 处理过 | 现有流程 | 今天线上的做法=对照原点 | 已有,误差 10% |
| B | 处理过 | AI 自主 | 只换掉干预方式 | 要跑 |
| C | 原始明细 | 现有流程 | 只换掉数据 | 要跑 |
| D ☠ | 原始明细 | AI 自主 | 全放手=张总 A 方案 | 要跑 |
| E | 原始明细 | AI 自主 | 用 AI 自我迭代框架跑,而非人工驱动大模型(与 D 同格,差在实现路径) | 要跑 |
4 组其实是一条从「全人工」到「全放手」的线,本次实验要回答的就是这条线上哪一点最准。
报告最后落在这四个减法上,前三个各只差一个开关,第四个比的是实现路径。
9/16 会议定的三条,先跑简化版,别一上来铺太多。
| 项 | 口径 |
|---|---|
| 验证集 | 统一一份,约 3,000 多条,全组共用且不得泄露 |
| 地区范围 | 只看七都 |
| 异常样本 | 完全不剔除。先跑不剔版做内部排序,之后再跑剔除版对照(验证集里约 13% 属会被剔掉的异常) |
可用工时 8 天。9/19 是周末(挂机跑),9/20 调休上班。9/24 完成初步试验与报告,9/25 中秋节休假,9/27 评审。
每项只有一个负责人,每项都有能验收的交付物。
| # | 任务 | 白话说明 | 负责 | 起 | 迄 | 交付物 |
|---|---|---|---|---|---|---|
| T1 | 需求与口径文档 | 讲清楚测哪些地区、用几年数据、数据从哪来、怎么算分 | 登荣 | 9/16 | 9/17 | 需求文档 |
| T2 | 冻结验证集 | 把「考卷」锁起来,5 组考同一张,不得泄露 | 君君・晓鑫 | 9/16 | 9/17 | 验证集文件 + 校验码 |
| T3 | 写评测器 | 统一「尺子」:只看七都、不剔异常、误差率口径一致 | 君君・晓鑫 | 9/16 | 9/17 | 独立评测模块 |
| T4 | 估原始版数据量级 | 按物件关联后会膨胀多少,跑不跑得动 | 启荣・叶祥 | 9/17 | 9/17 | 行数与耗时预估 |
| T5 | 产出处理版数据 | 现行特征工程版 | 启荣・叶祥 | 9/17 | 9/18 | 数据源表 + 关联键 |
| T6 | 产出原始版数据 | 明细不汇总;行为以统计指标给,不到单个用户 | 启荣・叶祥 | 9/17 | 9/18 | 数据源表 + 关联键 |
| T7 | 宏观数据抓取 | GDP、人口、经济等站外数据,固定格式即可 | 董静・佳兴 | 9/17 | 9/18 | 抓取结果表 |
| T8 | A 组基线复核 | 用新口径把线上这版重跑一次,确认评测器与格式统一 | 君君・晓鑫 | 9/18 | 9/18 | A 组成绩单 |
| T9 | 认领与工作表单 | 谁跑哪一组、跑到哪了,一张表看清 | 登荣 | 9/18 | 9/18 | 在线表单 |
| T10 | B/C/D 并行开跑 | 各人认领一组,9/19 先挂机,9/20 调休上班推进;9/24 完成初步试验并提交结果 | 君君・晓鑫・董静・佳兴 | 9/20 | 9/24 | 3 份成绩单 + 方案说明 |
| T11 | E 组:框架选型与部署 | 先跑通 RD-Agent,接上我们的数据集与评测器;其余框架视时间再试 | 江涛 | 9/17 | 9/24 | 框架跑通记录 + 成绩单 |
| T12 | 汇总对比报告 | 9/24 汇总初步试验结果,一行一组,末尾回答那四句话 | 登荣 | 9/24 | 9/24 | 对比报告 |
| T13 | 三方评审 | 定节后要不要继续投入、往哪投 | 三方 | 9/27 | 9/27 | 结论纪要 |
9/16 会议已明确的资源方案。按需提,提前搞定,别卡在开跑那天。
| 项 | 现状与方案 |
|---|---|
| Claude Code | 目前 3 人共用 1 个账号。按需申请增开,约 250 美元/账号/月,预算 1,500 以内已获同意。用量到 70–80% 提前报 |
| Codex 席位 | 公司平台席位可拉满,按需提 |
| 训练硬件 | 首选 Mac mini(中高配);次选云主机 GPU。注意:云主机配环境、导数据可能花 1–2 天,要算进工期 |
| 给 AI 查数 | 原始数据导入数据库,把只读账号给 AI 自行查询。必须做风控隔离 |
会议上定的约束,要写成代码,不能停在口头。没定完不许开跑。
| 规则 | 为什么 |
|---|---|
| 考卷锁死 | 验证集统一冻结,不得泄露给训练侧 |
| 尺子固定 | 只看七都、完全不剔异常,误差口径写死在评测器里 |
| 过程不管,结果统一 | 各人处理数据的方式可以不同,只要最后用同一个验证集、同一把尺子 |
| 断网跑 | 防止 AI 上网查到已公布的成交价,等于抄答案 |
| 预算封顶 | 每组设上限,超时按当前最好成绩交卷,防止一组拖垮全部算力 |
| 风险 | 应对 |
|---|---|
| 原始版数据膨胀,按物件关联后 N×N 跑不动 | 9/17 先报量级,必要时缩年限或缩地区 |
| 5 组口径不一致,最后没法横比 | 评测器先落地,9/18 用 A 组复核验证格式 |
| D 组全放手吃满算力 | 硬性预算封顶,超时交卷 |
| E 组框架部署卡住,跑不通就白占一周 | 9/17 就开始选型部署;优先 RD-Agent(支持自定义数据与评分程序);9/19 前跑不通则降级为只交部署结论 |
| AI 偷偷联网抄答案 | 断网执行 + 审方案说明 |
| 两周得不出 6%–8% | 目标本来就是拿排序,不是达成绝对值;天花板约 6% 已提前对齐 |
主线:市场量级决定路线。美国的量级支持 Zillow 一路走到撤掉专家系统;台湾的量级决定了只能靠专家系统 + 独有数据。
| 项 | 美国 | 台湾 | 倍数 |
|---|---|---|---|
| 住宅存量 | 约 1.487 亿套 | 约 957.6 万宅 | 15× |
| 年成交(可用干净样本) | 成屋约 400–410 万笔 | 中古屋干净成交约 8–10 万笔 | 40–50× |
| 历史深度 | 二十年,累计上亿笔 | 实价登录 2012 年起,约 164 万笔中古屋 | — |
| 挂牌与行为 | 数百家 MLS + 屋主自报 | 591 挂牌 2,000 万条售、1,860 万条租 | 结构同构 |
| 时间 | 这一步做了什么 | 覆盖 | 误差 | 降幅 |
|---|---|---|---|---|
| 2006–07 | 随机森林,全国一套模型 | 4,000 万 | 14% | 起点 |
| 2008–11 | 改成按县建模 | 7,500 万 | 12% | −2.0 |
| 2011–15 | 交易清洗;县级模型 + 堆叠 | 9,800 万 | 10% | −2.0 |
| 2015–17 | 街区特征、异常检测;高端房专款模型 | 1.06 亿 | 9.3% | −0.7 |
| 2018–19 | 清洗管道、历史成交整合 | 1.12 亿 | 8.5% | −0.8 |
| 2021–今 | 统一神经网络,撤掉特例规则 | 1.25 亿 | 7% | −1.5 |
图 1 · 数据量 vs 误差率:三家的位置
台湾整体数据量还不到 Zillow 2006 年起步时的四分之一,却已做到它中期的误差水平——差额由专家系统补上。也正因如此,右侧那条「撤掉专家系统」的门槛线,台湾走不到。
图 2 · 每一步降了多少、靠什么降的
唯一一次纯换模型(2021 神经网络)只降 1.5 点,其余 5.5 点都伴随数据工作或分区分群的结构调整。
| 数据体量 | 因此选择的做法 | 现在的位置 | 上限 | |
|---|---|---|---|---|
| Zillow | 亿级 | 数据够了,撤掉专家系统,结构交给统一神经网络 | 第六阶段,7% | — |
| 好时价 | 小,数据源单一 | 用强专家方法补数据不足:GIS 空间分析、人工筛选合理成交案例、十年持续打磨 | ≈ 第五阶段 | 受制于数据源,靠模型打磨已接近极限 |
| 591 | 小,但数据品类多 | 保留专家系统 + 扩数据品类:历史挂牌、挂牌变更、真实门牌、C 端与中介数据 | ≈ 第四阶段 | 可争第五至第六阶段区间(6–8%),但到不了「撤掉专家系统」那一步 |