中古屋估价 · 误差率分布与优化优先级 · 2026-10-10
误差集中在「没有这套房自己挂牌」的房子上
全台平均误差率 10.41%,但这是两群难度完全不同的房子混在一起的结果:
有这套房自己挂牌记录的 7.2%;没有挂牌记录的 18.2%,其中连同社区成交也找不到的高达 23.8%。
没有挂牌的这批合计只占 28% 的房子,却贡献了 49% 的总误差。
当前 · 全台平均误差率
—
3,288 套固定测试样本 · 2026-05-20 至 07-08
补齐挂牌信息后 · 对标测算
—
按「同房型 + 有挂牌」水平对标的上限估计
可回收空间
—
相当于当前误差的 30%,集中在 921 套房子上
一句话结论:下一步性价比最高的事,是把全网历史售房 / 租房挂牌抓全,并准确关联到具体房屋。
这件事覆盖 28% 的房子、49% 的误差;其次是透天的土地与临路信息专项。
已经估得准的那 65% 房子,整体改造的边际收益很低,建议只做异常个案维护。
01 / 为什么不能只看平均值
一半的房子误差率低于 5.6%,平均值是被右边的长尾拉高的
把 3,288 套房子按误差率从低到高铺开,形状是「左边一大堆、右边拖一条尾巴」。
真正拉高平均值的,是右侧那 406 套(12.3%)误差率超过 20% 的房子 —— 它们贡献了 50.7% 的总误差。
所以「把平均值降下来」的实际含义是 把右边这条尾巴变短,而不是让本来已经很准的房子再准一点。
全部 3,288 套的误差率分布
横轴为误差率档位(每 2 个百分点一档),纵轴为该档房子占全部样本的比例
看数字表
误差率 = |估价 − 实际成交价| ÷ 实际成交价。逐笔等权,不裁尾、不剔除样本。
把同一批房子按「有没有这套房自己的挂牌记录」分开,会得到两条形状完全不同的曲线。
这说明高误差不是随机波动,而是集中在一类可识别的房子上 —— 这类房子是可以被定位、也可以被补数据的。
同一批房子,按有无自身挂牌拆成两条分布
两条曲线各自以本组样本数为分母,因此可以直接比形状
「无可用自身挂牌」同时检查过站内与站外价格:有挂牌记录但价格无效、以及没有任何价格记录,都会落入这一组。
02 / 一眼看高低 · 核心图
按「这套房我们掌握多少信息」分层,误差率一级一级往上走
四层互不重叠,合计 3,287 套(1 套挂牌状态无法判定,未计入)。
从第一层到第四层,我们对这套房的了解越来越少,误差率从 7.2% 升到 23.8%,相差 3.3 倍。
每一条横条展示的是该层房子的误差率分布,不只是平均值。
信息完备度阶梯
横条按误差率分段着色:颜色越深代表误差越大
这套房我们掌握的信息误差率分布(该层内占比)平均误差率误差贡献
看数字表
「误差贡献」= 该层所有房子的误差率之和 ÷ 全部 3,288 套,再换算成占总误差的比例;四层相加约等于 100%。
它衡量的是对平均值的影响,不是金额损失。
这张图要记住的一件事:第三、四层合计 921 套(28% 的房子),贡献了 49% 的总误差。
它们的共同特征只有一个 —— 没有这套房自己的挂牌记录。第四层里有 28.1% 的房子误差率超过 30%,第一层只有 2.0%。
03 / 换维度验证
换任何一个维度切,最差的一端都是「缺自身挂牌」的房子
切换下面的维度,横条会按平均误差率从高到低重排,一眼就能看出哪些群体高、哪些低。
注意看房型:透天整体 15.5% 最差,但透天里有挂牌的只有 8.8%、无挂牌的高达 25.8% —— 房型本身的差异,远小于挂牌信息的差异。
按房型看误差率分布
每条横条内的比例以该组样本数为分母;仅显示样本数不少于 25 套的分组
分组误差率分布(组内占比)平均误差率误差贡献
看数字表
参考成交 = 系统为这套房选出的可比成交案例。各维度下分组的样本构成不同,组间差异不能直接当作该维度的独立影响。
04 / 哪里有机会 · 哪里空间不大
把「房型 × 挂牌情况」摊到同一张图上,优先级自己就浮出来了
纵轴是这一格的平均误差率(越高越难估),横轴是它对全台总误差的贡献(越右越值得动),
圆圈大小代表房子数量。右上角 = 又大又差 = 先改这里。
机会矩阵:房型 × 挂牌情况
仅显示样本数不少于 100 套的 9 个组合
看数字表(含全部 12 个组合)
分界线:横线为全台平均误差率 10.41%,竖线为 12 个组合的平均贡献 8.3%。分界线只用于分区阅读,不是业务合格标准。
再把「有机会」量化成一个数:假设这些房子补齐信息后,能做到同房型、有挂牌那一档的误差率水平,
全台平均误差率能下降多少?这是上限估计 —— 实际效果取决于抓到的挂牌质量和关联准确率。
可回收空间:对标「同房型 + 有挂牌」后,全台平均误差率能降多少
单位为百分点;合计 3.13 个百分点,即 10.41% → 约 7.3%
看数字表
单格可回收 = 该格房子数 × (该格误差率 − 同房型有挂牌组误差率) ÷ 3,288。
按房型分别对标,避免把房型结构差异误记为挂牌信息的功劳。
05 / 原因与解决方案
四件事,按性价比排序
每张卡片都标了证据强度:已观察到是数据直接支持的事实,
待核验是需要进一步验证的推断。
06 / 建议不要投入的方向
这几件看起来合理的事,数据显示收益很小
列出来是为了避免把资源投到看不见回报的地方。
07 / 这个结论靠不靠得住
三个角度的交叉检验
① 不是地区造成的假象
在七都内部、非七都内部分别重算,阶梯都成立
② 不是房型造成的假象
只看住宅大楼,阶梯同样成立
③ 换一个时间段,方向一致
验证期 2026-04-01 至 05-19,共 10,777 套,整体平均误差率 9.60%
两期模型各自按训练窗口保存,样本构成不同,这里只用于确认方向,不把两期数据混合比较。