5 组实验 · 实施计划

591 房产 AI 估价优化 | 依据 2026-09-14 张总会议、2026-09-15 三方会议 | 制定日 2026-09-16

9 月 24 日(周四)完成初步试验与报告

一、这次要干什么

一句话:把估价流程里两个「人工插手」的环节做成两个开关,2×2=4 组,再加一组用 AI 自我迭代框架跑的,共 5 组,同一批数据、同一把尺子各跑一遍。

目标误差率从现在的 10% 往 6%–8% 压,做到业内第一
这两周要的不是达成 6%–8%,而是拿到排序——证明 AI 自主到底有没有帮助,并排除不可行方向
数据范围15 年,成交约 160 万笔(每年约 10 万笔)
交付物5 组对比报告:误差率排序 + 耗时成本
9/16 执行会议的关键收敛:原 8 组改为 5 组。讨论中发现「AI 定模型」与「专家系统」其实是同一件事——专家系统就是我们定的规则,AI 自己定就是不给规则。两个因子合并后,只剩数据与干预两个开关;另由算法侧部署 AI 自我迭代框架作为第 5 组。

二、两个开关分别是什么

每个开关都对应一个待回答的问题。「是」那一侧=今天线上的做法。

开关 1 · 数据处理?

我们替 AI 算好的那些汇总数字,是帮忙还是帮倒忙?

处理过 = 现行
数据组(启荣・叶祥)做好的特征工程版:30 天、180 天等汇总指标,挂牌数据也已做成字段。
原始明细
不做汇总,一笔一行;另加抓取的宏观数据(GDP、人口等)与行为统计指标。

交付形态是几份数据源表 + 关联键,不是一张大宽表;关联关系由数据组给,不让 AI 自己拼。
风险:原始版按物件关联后会膨胀,最坏是 N×N,量级须先评估。

开关 2 · 干预方式?

让 AI 自己想办法,比我们现有这套流程更好吗?

现有流程 = 现行
多个模型串行(每个环节选型不同)+ 比较法 + 专家规则兜底。
AI 自主
只给数据和目标,不讲估价师怎么做,让它自己找路径。

这个开关已经把原来的「AI 定模型」和「专家系统」合并了——不给规则就等于拿掉专家系统
本阶段不考核可解释性,只看精度;可解释性留到选型阶段再谈。

两个开关之外,全部固定不动:验证集、评分口径、关联关系、字段命名。各人处理数据的方式可以不同,但验证集必须统一,且不得泄露

三、5 组长什么样

A 是今天的做法(已有结果),D 是全放手,E 与 D 同样全放手但换一条实现路径。B、C 各只拨一个开关,所以差多少就是那一个环节值多少。

数据处理干预方式这组代表什么状态
A ★处理过现有流程今天线上的做法=对照原点已有,误差 10%
B处理过AI 自主只换掉干预方式要跑
C原始明细现有流程只换掉数据要跑
D ☠原始明细AI 自主全放手=张总 A 方案要跑
E原始明细AI 自主用 AI 自我迭代框架跑,而非人工驱动大模型(与 D 同格,差在实现路径)要跑
实际需跑 4 组(B、C、D、E),A 已有结果。
D 与 E 的区别:D 是人工驱动大模型(ChatGPT goal/Claude Code loop);E 是部署现成的自我迭代框架,自带「提假设 → 生成代码 → 跑实验 → 分析反馈 → 继续」的闭环。底层同样依赖大模型,但流程是框架管的。
E 组用什么框架:候选五个(微软 RD-Agent、AlphaEvolve/OpenEvolve、AIDE/Weco、AutoGluon Assistant、RDL/RelBench)。优先 RD-Agent——它支持自定义数据集与评分程序,能直接接我们的评测器,口径可控。(框架清单由江涛 9/16 提供)

四、插手程度光谱

4 组其实是一条从「全人工」到「全放手」的线,本次实验要回答的就是这条线上哪一点最准。

◀ 人工插手多人工插手少 ▶
A ★
今天的做法
误差 10%
B · C
各放手一个环节
D · E ☠
全放手
D 人工驱动|E 框架驱动

五、最后要回答的四句话

报告最后落在这四个减法上,前三个各只差一个开关,第四个比的是实现路径。

C - A
喂原始明细 vs 喂汇总特征,差多少个百分点
B - A
AI 自己想办法 vs 现有流程,有没有增量
D - A
全放手 vs 全现状,纯自主的真实代价
E - D
自我迭代框架 vs 人工驱动大模型,框架值不值得投

六、评分口径

9/16 会议定的三条,先跑简化版,别一上来铺太多。

口径
验证集统一一份,约 3,000 多条,全组共用且不得泄露
地区范围只看七都
异常样本完全不剔除。先跑不剔版做内部排序,之后再跑剔除版对照(验证集里约 13% 属会被剔掉的异常)
目标现实性要先对齐。算法侧评估:在有社区、有楼栋、数据充足的情况下,天花板约 6%;且当前验证集本身尚未清洗干净。本轮只要排序,不承诺绝对值。

七、时间安排

可用工时 8 天。9/19 是周末(挂机跑),9/20 调休上班。9/24 完成初步试验与报告,9/25 中秋节休假,9/27 评审。

9/16
9/17
9/18
9/19
周末
9/20
调休上班
9/21
9/22
9/23
9/24
9/25
中秋休假
9/26
周末
9/27
评审
需求与口径文档
登荣
评测器+验证集
君君・晓鑫
两版数据
估量级
启荣・叶祥
宏观数据抓取
董静・佳兴
A 组基线复核
必过
B/C/D 并行开跑
挂机
君君・晓鑫・董静・佳兴
E 组 · 框架部署
江涛・选型部署
江涛
汇总对比报告
登荣
三方评审
9/27
每日站会:18:00,15 分钟,只说三件——昨天跑完哪组、今天跑哪组、卡在哪。

八、具体实施计划表

每项只有一个负责人,每项都有能验收的交付物。

#任务白话说明负责交付物
T1需求与口径文档讲清楚测哪些地区、用几年数据、数据从哪来、怎么算分登荣9/169/17需求文档
T2冻结验证集把「考卷」锁起来,5 组考同一张,不得泄露君君・晓鑫9/169/17验证集文件 + 校验码
T3写评测器统一「尺子」:只看七都、不剔异常、误差率口径一致君君・晓鑫9/169/17独立评测模块
T4估原始版数据量级按物件关联后会膨胀多少,跑不跑得动启荣・叶祥9/179/17行数与耗时预估
T5产出处理版数据现行特征工程版启荣・叶祥9/179/18数据源表 + 关联键
T6产出原始版数据明细不汇总;行为以统计指标给,不到单个用户启荣・叶祥9/179/18数据源表 + 关联键
T7宏观数据抓取GDP、人口、经济等站外数据,固定格式即可董静・佳兴9/179/18抓取结果表
T8A 组基线复核用新口径把线上这版重跑一次,确认评测器与格式统一君君・晓鑫9/189/18A 组成绩单
T9认领与工作表单谁跑哪一组、跑到哪了,一张表看清登荣9/189/18在线表单
T10B/C/D 并行开跑各人认领一组,9/19 先挂机,9/20 调休上班推进;9/24 完成初步试验并提交结果君君・晓鑫・董静・佳兴9/209/243 份成绩单 + 方案说明
T11E 组:框架选型与部署先跑通 RD-Agent,接上我们的数据集与评测器;其余框架视时间再试江涛9/179/24框架跑通记录 + 成绩单
T12汇总对比报告9/24 汇总初步试验结果,一行一组,末尾回答那四句话登荣9/249/24对比报告
T13三方评审定节后要不要继续投入、往哪投三方9/279/27结论纪要

九、算力与环境

9/16 会议已明确的资源方案。按需提,提前搞定,别卡在开跑那天。

现状与方案
Claude Code目前 3 人共用 1 个账号。按需申请增开,约 250 美元/账号/月,预算 1,500 以内已获同意。用量到 70–80% 提前报
Codex 席位公司平台席位可拉满,按需提
训练硬件首选 Mac mini(中高配);次选云主机 GPU。注意:云主机配环境、导数据可能花 1–2 天,要算进工期
给 AI 查数原始数据导入数据库,把只读账号给 AI 自行查询。必须做风控隔离
提醒:训练本身吃的是 CPU/内存,与大模型账号无关。真正要防的是让大模型在循环里反复触发训练——那会同时烧掉算力和时间。

十、开跑前必须定好的五条

会议上定的约束,要写成代码,不能停在口头。没定完不许开跑。

规则为什么
考卷锁死验证集统一冻结,不得泄露给训练侧
尺子固定只看七都、完全不剔异常,误差口径写死在评测器里
过程不管,结果统一各人处理数据的方式可以不同,只要最后用同一个验证集、同一把尺子
断网跑防止 AI 上网查到已公布的成交价,等于抄答案
预算封顶每组设上限,超时按当前最好成绩交卷,防止一组拖垮全部算力

十一、风险与应对

风险应对
原始版数据膨胀,按物件关联后 N×N 跑不动9/17 先报量级,必要时缩年限或缩地区
5 组口径不一致,最后没法横比评测器先落地,9/18 用 A 组复核验证格式
D 组全放手吃满算力硬性预算封顶,超时交卷
E 组框架部署卡住,跑不通就白占一周9/17 就开始选型部署;优先 RD-Agent(支持自定义数据与评分程序);9/19 前跑不通则降级为只交部署结论
AI 偷偷联网抄答案断网执行 + 审方案说明
两周得不出 6%–8%目标本来就是拿排序,不是达成绝对值;天花板约 6% 已提前对齐
预判:C ≈ A 或略差、B 增量有限、D 翻车、E 受限于部署时间。翻车本身就是可交付的结论——知道哪条路走不通,节后才好定新目标。

十二、对标 Zillow

主线:市场量级决定路线。美国的量级支持 Zillow 一路走到撤掉专家系统;台湾的量级决定了只能靠专家系统 + 独有数据。

1 · 市场差异:美国是台湾的几十倍

美国台湾倍数
住宅存量约 1.487 亿套约 957.6 万宅15×
年成交(可用干净样本)成屋约 400–410 万笔中古屋干净成交约 8–10 万笔40–50×
历史深度二十年,累计上亿笔实价登录 2012 年起,约 164 万笔中古屋
挂牌与行为数百家 MLS + 屋主自报591 挂牌 2,000 万条售、1,860 万条租结构同构
整个台湾的成交量,相当于美国一个中型州。

2 · Zillow 的算法演变

时间这一步做了什么覆盖误差降幅
2006–07随机森林,全国一套模型4,000 万14%起点
2008–11改成按县建模7,500 万12%−2.0
2011–15交易清洗;县级模型 + 堆叠9,800 万10%−2.0
2015–17街区特征、异常检测;高端房专款模型1.06 亿9.3%−0.7
2018–19清洗管道、历史成交整合1.12 亿8.5%−0.8
2021–今统一神经网络,撤掉特例规则1.25 亿7%−1.5
两个事实:① 二十年降 7 点,其中 5.5 点在树模型阶段完成,换模型只拿到最后 1.5 点;② 专家系统一路保留到 1.25 亿套之后才撤——不是不想撤,是数据不够撑不住。

图 1 · 数据量 vs 误差率:三家的位置

目标区间 6–8% 15%13%11% 9%7% 误差率(越低越好) 1,000 万5,000 万 1 亿2 亿 数据量 · 覆盖房屋数(对数刻度) 台湾住宅存量 957.6 万宅 (年可用干净成交仅 8–10 万笔) Zillow 撤掉专家系统的门槛 1.25 亿套 2006–07 · 14% 2008–11 · 12% 2011–15 · 10% 2015–17 · 9.3% 2018–19 · 8.5% 2021– · 7% 同样的误差水平,Zillow 用了 1.06 亿套,我们用不到 1,000 万宅 591 线上 10.37% 591 离线 9.2% 好时价 8.2% 口径提醒:Zillow 为中位误差,591 与好时价为平均误差,位置为粗略对位,不可直接相减。
Zillow 二十年轨迹 591 好时价 目标区间 6–8%

台湾整体数据量还不到 Zillow 2006 年起步时的四分之一,却已做到它中期的误差水平——差额由专家系统补上。也正因如此,右侧那条「撤掉专家系统」的门槛线,台湾走不到。

图 2 · 每一步降了多少、靠什么降的

−2.0 2008–11 按县建模 −2.0 2011–15 交易清洗 −0.7 2015–17 异常检测+分群专家 −0.8 2018–19 清洗管道+历史成交 −1.5 2021–今 统一神经网络 降幅(百分点)
数据 模型 数据+专家系统

唯一一次纯换模型(2021 神经网络)只降 1.5 点,其余 5.5 点都伴随数据工作或分区分群的结构调整。

3 · 市场体量决定各自能走到哪

数据体量因此选择的做法现在的位置上限
Zillow亿级数据够了,撤掉专家系统,结构交给统一神经网络第六阶段,7%
好时价小,数据源单一用强专家方法补数据不足:GIS 空间分析、人工筛选合理成交案例、十年持续打磨≈ 第五阶段受制于数据源,靠模型打磨已接近极限
591小,但数据品类多保留专家系统 + 扩数据品类:历史挂牌、挂牌变更、真实门牌、C 端与中介数据≈ 第四阶段可争第五至第六阶段区间(6–8%),但到不了「撤掉专家系统」那一步
三句话
好时价的选择,就是 Zillow 早中期的做法——数据体量不足时用专家方法补:分区、异常剔除、人工筛案例。它证明了小数据下这条路能走到 8% 附近。
591 现在站在 Zillow 第四阶段(街区特征 + 异常检测 + 分群专家)。往前两站靠的是清洗管道、历史成交整合与挂牌信息接入——正好对应我们的四项独有数据,这是台湾唯一有的牌。
全 AI 自主在台湾不是路线选项,是对照组。 Zillow 撤特例规则的前提是 1.25 亿套、年成交 400 万笔;台湾到不了那个密度。本轮 G7 的价值是量出「放手的代价」,不是期待它赢。