实界智库 ← 回要报
馆藏总目
馆藏总目

它能读的就这四库

读不到的那些,写在同一页上。四个数量是做这一页的时候现查的, 查出多少写多少。

四库总目

下面这四个数不是抄来的,是做这一页的时候直接去库里数出来的。要报首页那四格数的也是同样四条,两边对不上就是出了问题。

政府说的话市级政府工作报告7,2972002–2025 年,333 个市级单元
企业说的话上市公司年报「管理层讨论与分析」58,4062010–2025 年,5,729 家公司
企业花的钱上市公司历年财务记录66,2182008–2023 年,5,672 家公司、302 个城市
国家划的圈国家人工智能试验区182019 年起分批批复,其中 4 个批复年份查不到
哪一年有哪一库
政府工作报告
年报里的那段话
企业逐年账目
国家划的圈
20022025

深的那一格表示那一年有数据。四库的年份并不对齐——能同时用上四库的年份只有中间那一段。

每一库里有什么

每一库里存的是什么,下面按库列出来。研究员能点名要的就这些,别的问不到。

市级政府工作报告13 项
城市、省份、年份、报告正文,再加几项存档用的记录(文件来源、入库时间之类)。正文是全的。公文可以展示原文,数词频、做检索都在原文上进行。
年报里的管理层讨论29 项
公司代码、简称、年份、行业、正文,以及一批现成算好的文本指标(字数、句数、正负面词数、语气分、审计意见等等)。这一库只用来做语料统计。研究员做真实数据那条线时读不到它。
企业逐年的账目14 项
公司编号、年份、所在城市、省份、行业、是不是金融业,以及总资产回报率、净资产收益率、负债率、无形资产比重、资产增速、每股净资产、每股营业收入。研究员做真实数据那条线时,能看见的就这些。问别的,环境会把有哪些列整列退回去,不替它猜。
国家人工智能试验区7 项
名称、所在省、经纬度、批复年份,外加一个把握程度和一句备注。批复年份允许是空的。查不到就空着,不补。

读不到什么

下面六条是这四库答不了的事。写在这里不是免责,是因为不知道边界在哪,上面那些数字就会被读成它并没有的意思。

没有标准答案
真实数据上没人知道正确结论是什么,所以算不出对错,只能看过程守不守规矩。成绩单上那些「答对比例」来自我们自己造的题,不来自这四库。
做真实题时看不到年报正文
逐年账目那一库里没有任何一段文字。年报里的话单独存在另一库,研究员做真实题的时候读不到它。
不知道是不是国企,也没有专利
账目里既不写这家公司是国企还是民企,也没有专利。研究员问过是不是国企,环境如实答了没有。
公司挂在现在的城市名下,不是当年的
公司所在城市取的是它眼下登记的地址。中途搬过家的公司,早年那几行也会算在现在这个城市头上。
按「规模」分组,量的其实是收入
要按大小分组时,分的是每股营业收入当年的高中低三档,不是按总资产分。叫它规模,量的却不是资产。
年报正文被切断过
2010 到 2023 年,每年最长的一篇都卡在三万四千字上下,看得出是被切了。顶到这个长度的比例,2021 年 23.8%,2022 年 27.2%,2023 年 29.9%。2024 年以后没有这道坎,最长的一篇四十万字以上,同一个判法就不适用了。
年报那一库,每年有多少篇是被截断的(百分比)
哪一年百分比
2010 年4.5
2011 年17.5
2012 年4.3
2013 年5.2
2014 年7.8
2015 年3.0
2016 年4.1
2017 年4.3
2018 年4.9
2019 年5.2
2020 年5.2
2021 年23.8
2022 年27.2
2023 年29.9

这几年的原文都卡在同一个字数上限上,越靠后越严重。用这一库做长文本分析要先知道这件事。

授权边界

前两条方向相反,容易被并成一句话说,那样两条都会说错。公文可以给原文,企业数据不可以。

政府工作报告
国家机关公文,可以展示原文。本刊引用的每一句都能翻回到原件。
上市公司数据
只以汇总统计呈现,不展示可识别到具体公司的原始值。本页没有一条样例记录,也不提供任何形式的数据浏览。
个人信息
原始的公司资料表里有董秘、证券事务代表的姓名和电话。读数据那一步只取前面 27 列里挑出的 8 列,后面的联系方式一列都不碰——不读、不存、更不上页。

研究说明

现查

这一页上的四个数量,是做这一页的时候直接去库里数出来的,不经过任何中间文件。要报首页那四格数的是同样四条,两处对不上就是构建出了问题。

库在哪

四个库都在挂载的数据盘上,不在代码仓库里。仓库里只有读它们的程序和口径定义。

授权

政府工作报告为公开公文,可展示原文;上市公司数据只以汇总统计呈现。