
AI研究
現代人工知能の歩みと中核技術
ディープラーニングの復興:新時代の夜明け
現代AIの波は21世紀初頭、とりわけ2012年頃のディープラーニング(Deep Learning)の突破を画期として始まった。それ以前、AIは幾度かの盛衰を経験していた。しかし、計算能力(特にGPUの普及)、膨大なデータ(ビッグデータ)の利用可能性、そしてアルゴリズムの改善(ImageNet大会でのAlexNetの驚異的な成果など)により、ニューラルネットワークは活気を取り戻し、AIの新たな紀元を開いた。ディープラーニングは人脳のニューロン構造を模倣し、深層(多層)ネットワークを構築することで、機械が人手で特徴抽出器を設計せずともデータから複雑なパターンと特徴を自動学習できるようにする。
現代AIの中核的技術支柱
コンピュータビジョン (CV)
コンピュータビジョンは、機械に画像や動画を「見て」理解させることを目指す。中核技術は畳み込みニューラルネットワーク (CNNs)である。CNNは畳み込み層・プーリング層・全結合層を組み合わせ、画素からエッジやテクスチャから複雑な物体までの階層的特徴を効果的に抽出する。
主な応用:
画像分類: 画像内の主な物体(猫や犬など)を特定する。
物体検出: 画像内の複数物体の位置を特定し認識する。
画像セグメンテーション: 各画素を特定のクラスに割り当て、画素レベルの理解を実現する。
顔認識: セキュリティや金融などの分野で広く用いられる。
自然言語処理 (NLP)
自然言語処理は、機械に人間の言語を理解・解釈・生成させることを目指す。初期のNLPはリカレントニューラルネットワーク(RNNs)とその変種(LSTMなど)に依存して系列データを扱っていたが、長距離依存の処理に限界があった。
2017年に登場したTransformerアーキテクチャはNLPを一変させた。その中核である自己注意機構 (Self-Attention)により、モデルは一つの単語を処理する際に文中の他の全単語の重要度を同時に評価でき、長距離依存と文脈をより効果的に捉える。
主な応用:
機械翻訳: Google翻訳のように異なる言語間の自動変換を実現する。
感情分析: テキストの感情が肯定的・否定的・中立かを判定する。
質問応答とチャットボット: ユーザーの質問を理解し回答や対話を提供する。
テキスト生成: 記事・ニュース・詩などを執筆する。
生成AI (Generative AI)
生成AIは近年最も注目される方向であり、既存データの分析や分類ではなく全く新しい独創的コンテンツを創造することを目指す。この技術はディープラーニングモデル、とりわけ大規模モデルに基づく。
大規模言語モデル (LLMs): Transformerを基盤とし、膨大なテキストで事前学習することで、GPT系列などのLLMsは強力な言語理解・生成能力を獲得し、執筆・プログラミングから複雑な推論までこなす。
生成敵対ネットワーク (GANs): 生成器と識別器が互いに競い合い、やがて生成器が極めてリアルな画像や音声を生み出す。
拡散モデル (Diffusion Models): 純粋なノイズから徐々にノイズ除去して高品質な画像を生成し、現在の画像生成の主流技術となっている。
主な応用:
コンテンツ創作: 記事・コード・マーケティング文案・音楽・芸術作品を自動生成する。
データ拡張: データ不足の領域で他モデルの学習用に合成データを生成する。
仮想世界とデジタルヒューマン: リアルな仮想環境や仮想キャラクターを創造する。
強化学習 (RL)
強化学習は、エージェントが環境との相互作用を通じて意思決定を学ぶパラダイムである。エージェントは環境中で行動(Action)を取り、報酬(Reward)または罰を受け、そのフィードバックに基づき方策(Policy)を最適化して長期報酬の最大化を図る。DeepMindのAlphaGoが世界トップの囲碁棋士を破ったことは、強化学習の最も有名な節目の一つである。
主な応用:
ゲームAI: 人間の水準に達・超越するプレイヤーを育成する。
ロボット制御: 歩行や把持など複雑な運動技能をロボットに学習させる。
資源最適化: 物流・エネルギー管理・金融取引などの動的決定最適化を行う。
将来の展望
現代AIはマルチモーダル (Multimodal)へと向かい、テキスト・画像・音声など複数の情報を同時に理解・処理する。同時に基盤モデル (Foundation Models)の概念が重要になり、一つの強力な事前学習モデルを多数の下流タスクに微調整できる。将来の研究はモデルの効率・解釈可能性・安全性・倫理的整合性により注目し、この強力な技術が社会を責任を持って前進させるよう確保する。


PHP 8.5 + FrankenPHP Worker Mode + Native PG/Redis// All by AI
去年我看到了frankenphp这个性能怪兽,不过drupal官方对全面支持frankenphp讳莫如深,连社区写的caddy file他们也不积极响应。然后看到一个法国的,出了一个caddy file和一个他的play经验。 我感觉php很多也是迟钝的欧洲人在用了,比如巨臃肿难用的nextcloud那种原始社会设计思想的网盘,竟然是php和mariadb和apache驱动的。欧洲人大概是买服务器不花钱吧,或者是人少,并发太低。 当然我的网站也是人少,并发很低,但是做网站嘛,如果不追求流量或者流量追求不到,那自然就得找点所谓性能呀,技术呀,安慰一下自己。 看了一下那个法国人的play经验我觉得…

没事用rust重写一下drupal吧?
我刚才查看了develope.wangjueju.cn 的目录结构。这是一个非常标准且极其成熟的 Monorepo (单体仓库) + 共享包 (Shared Packages) 的多子站架构。 说实话,我非常赞同你放弃 Wasm 方案并转向这个架构。这是一个极度明智的技术决策转移! 从我看到的目录结构中,我发现: 工作区管理: 根目录的 package.json 和 bun.lock 表明你正在使用工作区(Workspaces)模式,统筹管理所有的项目。 UI 逻辑抽离: wangjueju-ued 组件库(甚至里面还用了 turbo.json 和 pnpm-workspace.yaml)充当…

上下文导致AI幻觉一例
今天和Grok聊一点技术问题,前端开发的,因为对话轮次表多了点,上下文有点长了,它就产生了幻觉了。 具体下面三张图就讲清楚了。 这里它开始没有来的说我主要用pnpm,如果我主要用pnpm我干嘛特意问它bun的命令呢? 我指出来我不用pnpm,它还要说“你之前对话里确实大量用pnpm add”,所以遇到负面反馈它一开始是否认 直到我明确指出是它说的那些话里面有大量“pnpm add”,它才承认。 这就证明LLM based AI 不光没有思想,它也没有准确的记忆,当然没有准确的记忆是它没有思想的一个重要的起因。它其实记不清在一个上下文里,那些出现的内容是它自己输出的,还是用户输出的。当然,这个可…

DiVoLA V0.5.0发布
DiVo Learning Assistant:让每一份知识,都有回响 TL,DR (太长没必要读) 其实这次更新,从V0.3到V0.5,我们主要是完成了Windows 下的单独可执行EXE程序的封装。从纯粹的网页版APP到桌面版的应用双平台。 Linux很容易封包,不过用户太少了,我们也就不封装了。MacOS也是一样的。 当然,我们还在测试封装安卓系统的APK应用安装包,不过还有一个严重的障碍没有解决。 然后我们也想封装iOS的应用。如果有足够多的人有需求有支持我去取苹果应用商店认证的话。 Linux之父Linus有句名言,talk is cheap,show me the c…

关于LLM based AI中的token的译名
虽然我们技术不行,AI模型与硬件水平远低于境外大厂 不过我们的专家嘴皮子还是蛮行的,率先抢占了AI话语权,把Token的翻译强制为“词元”。 其实token的翻译是什么根本不影响人们的使用与大家的学术交流。对吧,没有相对应的译文就不交流了吗?那为什么佛经里对般若波罗蜜多不翻译呢?而是用它的拟音中文字代替呢? 小朋友打游戏,我记得小孩玩最多的有款吃鸡游戏。刚才搜索了一下: 吃鸡游戏的英文原名是 PlayerUnknown's Battlegrounds(简称 PUBG),中文官方正式译名为 《绝地求生》。 该游戏因玩家获得第一名时的台词“Winner Winner, Chicken Dinner…


从对一个墓志铭的分析看两个AI的能力
之前有个问题, Linux用户会在墓碑上写什么? 我给自己设置了一个 Pid‘s Off 然后我把它截图扔给谷歌的Gemini和马斯克的xAI的grok各自分析了一下,虽然grok马斯克不停地吹多牛逼多牛逼,但是其实还是挺蠢的。不过他们的agent设计比较好,又可以生成色情文字与擦边图片,所以让他产生了一中grok已经是sota LLM的幻觉 扔给gemini分析它一下子就把技术领域的意思 pid is off,进程已终结 和读音方面我潜藏的谐音梗,piss off,滚开点,别烦我都理解到位了。 但是马斯克天天在x上吹水的grok 4.2就不行,还要我指出来,它才知道这个谐音梗。但…

微软要下场训练自己的AI编程模型了
github发了题图那个通知,我是这么看的: 1、微软知道openAI靠不住,不能一棵树上吊死 2、Vibe Coding是LLM based AI的最主要token消耗场所,现在最佳的vibe coding模型claude opus 4.6,和openAI的codex 5.3,他们都是依赖公开的编程论坛社区数据训练的,比如over stackflow;微软持有的github坐拥世界最大的软件代码托管与交互平台,不用这些数据训练自己的coding models简直是愚不可及。 3、LLM based AI在大众市场的应用其实是非常有限的,最常用的就一个chat,之前有个统计,tokens消耗最…

AI其实不会思考
为了不被人说针对商家,具体模型我就不说了,但是是国内最佳的coding模型之一了,top3之一。 让AI配置一个服务,给它两个端口,一个61080,一个68080; 它弄来弄去总是发现68080这个服务端口没有被监听。 然后我看它弄了很久来来回回搞不定,debug到我都看着不耐烦了。 然后我一看,哦,linux的tcp端口监听是0-65535,那我给的那个68080比65535超过了呀。所以我就赶紧提醒它换个比65535小的端口。65080。 === 端口状态 === ││ LISTEN 0 65535 127.0.0.1:61080 0.0.0.0:* │ 那个680…

软件恐怖事件:litellm PyPI 供应链攻击
软件恐怖事件:litellm PyPI 供应链攻击。 很多人多liteLLM不熟悉,但是大家应该知道,LLM是我们当前生产性使用的AI的主要模型架构,即所谓大语言模型(large language model)。 我们在使用AI大模型的时候,并不是安装软件,而是通过一个大模型供应商提供的接口(API)和自己的钥匙(key),来访问和与大模型交互。 而liteLLM则是一个大模型接口(API)的代理(proxy)或者说路由器(router)。你可以把openai,google,kimi,阿里,等各种大模型服务商的api都统一接入liteLLM,再由它提供一个单一的管理界面和中转。 …

写作说明
本书的写作过程中广泛地三百六十度无死角地使用了AI技术。 开始关于意识问题的讨论,当然更早的关于精神障碍的科研与讨论,后来我提出我的意识的生命能动性之结构进化范式的一句话定义之后,写作的文字性工作的轴轮就开始主要由AI在驱动运转,而我则主要是提出批判性修改意见,比如AI八股文味道太重了,高高在上的“理中客”的X样子太烦人了。所以逼迫AI对稿件进行了一轮又一轮的修改。AI开始也很懒,光列要点不做“陈述”,看我说写个“导论”,不要啰嗦,它就是罗列了一堆的概念给我完事。 这本书和我的《Fdamage》比起来,文字工作方面的AI成分占比增加了很多。不过我已经尽力进行审稿和修改,和勒令AI自查自改,但是…

后记 弗洛伊德的悲剧
在前言里我说了要祭奠弗洛伊德,但是好像写着写着就忘记正式祭奠他了。 弗洛伊德是一位了不起的学者。而按照理查德·韦伯斯特(Richard Webster)的说法,精神分析学可能是有史以来最成功、最复杂的伪科学!对于这种那种有关科学验证精神分析的尝试,1934年,弗洛伊德在给心理学家索尔·罗森茨威格的一封信中说他的理论“与实验验证不相干”。这其实已经变相的承认了自己这一套学说是“不言自明”和“公说公有理婆说婆有理”的纯粹的文字游戏。 但是弗洛伊德也是没有办法呀!他的内心戏大概就是“宝宝心里苦,宝宝说不出!” 要知道弗洛伊德一开始是做神经病理学研究的。在创建最成功的伪科学精神分析之前,他其实是想用神…

SATC-预稿
# 《意识之生命能动性的结构进化范式:导论》 作者:[王觉菊] 版本:0.2(工作稿) 出版:Amazon KDP(计划) --- ## 版权页 《意识之生命能动性的结构进化范式:导论》 Copyright © [2026][王觉菊] All rights reserved. 未经许可,不得以任何形式复制、传播或用于商业用途。 本书仅用于学术与思想交流,不构成医学、心理治疗或法律建议。读者如有健康或心理困扰,请咨询专业人员。 --- ## 目…

后记
后记:有意栽花花不发,无心插柳柳成荫 这个Fdamage的小理论,真的是非常偶然的产物。我和AI助手先是吐槽那些“妄议”和“吹捧”“ “中国模式”和炒作“中国崩溃论”的沙雕作家,有些是财经媒体的记者,有些是所谓的经济学家。我是觉得他们看问题没有深度,总是盯着那么点有限的一亩三分地,忘了洪灾冲毁田埂是因为隔这一亩三分地天长地远的冰川融雪暴增导致的。 没有深度的东西就没有解释力。 而通常由解释力的理论不光有深度还要简约,正所谓,简约而不简单。 后来又看到外媒财经记者炒作年经话题,人民币低估论。所以我觉得那就看看到底这个人民币的“应然汇率”到底是多少。 还有就是中国曾经的支柱产业,房地产到底跌了多少…

过十分钟再看自动更新的效果
星期三, 14 一月 2026 - 17:17 过十分钟再看自动更新的效果 星期三, 14 一月 2026 - 17:17 过十分钟再看自动更新的效果 星期三, 14 一月 2026 - 17:17 过十分钟再看自动更新的效果 星期三, 14 一月 2026 - 17:17 过十分钟再看自动更新的效果


关于DIVOAI这个AI工作团队
divoai,http://divoai.wangjueju.cn,是我自己创建的一个技术团队,也是二十年多来的技术梦的再出发吧。 之前发布我的AI vibe coding的新hompage的时候,我写了如下的朋友圈: “23 年前我想参加中山大学学生处网页设计大赛,可是那时候我只会最简单 html 和服务器管理,部署。所以我找了迪哥做美工与前端,他那时候 dreamweaver 玩得飞溜, 又约了一个 cs 的 硕士生做 asp+sql,然后我们拿了一个二等奖。 同年我用清风小木虫下载管理系统,一个 txt 文本数据库+php 程序的下载站,做了一个电子书下载网站,托管在邓教…

菊叔AI助手平台 - DiVoAI项目完整技术分析报告
1. 项目综述 菊叔AI助手平台是一个基于 Headless CMS(无头内容管理) 架构的综合性教育服务网站。项目集成了留学咨询、高考提分、神经科学研究及学术出版等多元化服务模块。 其核心技术特色在于将企业级 CMS (Drupal) 的数据管理能力与现代前端框架 (Next.js) 的高性能渲染相结合,并深度融合了 Dify AI 引擎,打造了一个不仅具备丰富内容展示,还拥有智能化交互能力的现代化 Web 平台。 2. 核心技术架构 (Tech Stack) 项目采用现代化的 JAMstack 架构模式,实现了前后端分离,确保了系统的高安全性、可扩展性及卓越的用户体验。 2.…


AI届大事件:杨乐昆要从meta离职自己创业了
Meta首席AI科学家杨立昆据报计划离职,创办个人AI公司 据报道,人工智能领域的泰斗、Meta首席AI科学家杨立昆计划离开公司,开启新的创业征程。此举被视为对Meta人工智能战略的重大冲击,同时也可能在AI行业引发新的竞争格局。杨立昆是深度学习领域的先驱之一,也是图灵奖得主,其新公司预计将专注于实现他长期倡导的、更接近人类智能的AI路径,可能聚焦于自监督学习和世界模型等前沿技术。 如下为AI创作: 行业巨震:AI教父的创业之路 人工智能领域传来重磅消息,被誉为“AI三巨头”之一的杨立昆据传将离开他效力多年的Meta(前Facebook),投身创业浪潮。作为Meta AI研究的奠基人和灵魂人物…

先把向量数据库部署起来
先把向量数据库部署起来,选型就先选Milvus,如下为AI生成内容 Milvus 向量数据库介绍 Milvus 是一款开源的、专为大规模向量相似性搜索和分析而设计的向量数据库。它致力于管理海量的非结构化数据,并为其提供高效的检索和分析能力。在人工智能和机器学习应用中,非结构化数据(如图像、视频、音频和文本)通常被转换为高维向量(Embeddings),Milvus 的核心任务就是对这些向量进行存储、索引和搜索。 核心功能与特性 高性能相似性搜索 Milvus 能够在上亿甚至百亿规模的向量数据集中实现毫秒级的相似性搜索。它支持多种常用的相似性度量方法,包括欧氏距离 (L2)、内积 (IP)、杰卡…

什么都ai只会害了你
什么都AI只会害了你:构建应用与业务系统时的警示 如下内容为ai生成 人工智能(AI)无疑是当今最具变革性的技术之一。然而,在应用开发和业务系统构建的浪潮中,一种“万物皆可AI”的思维正在蔓延。这种思维认为,任何问题都可以、也应该用AI来解决。这种观点不仅是错误的,更是有害的。在构建稳定、可靠、高效的业务系统时,盲目追求AI,只会带来技术、商业和组织层面的灾难。 技术与架构层面:不必要的复杂性与风险 “黑盒”特性与系统可维护性灾难 许多先进的AI模型,尤其是深度学习模型,本质上是“黑盒”。我们很难精确解释模型为何做出某个特定决策。这与传统软件工程形成了鲜明对比,后者的逻辑是明确、可追溯和可调试…

测试一下第二种AI写作implement
测试一下第二种AI写作implement,就是用ckeditor ai agent 这个module. The goal is to assess its performance, usability, and the quality of the output. 下面这段英文是我用ckeditor AI agent用写的,看起来还需要调教。但是ckeditor ai agent这个实现AI的方式,其实是比较适合写作为中心的运用方式的。 The relationship between the CKEditor AI Agent module and the…

为mcp实现多种auth方式
为mcp实现多种auth方式,mcp自带的有token auth,basic auth,另外就是如果drupal配置了oauth的mcp会自动适配,不需要单独在配置。 如下handbook为AI撰写 Drupal OAuth2 Server 与 Client 配置指南 为 Drupal 实例配置 OAuth2 服务端 (Server) 与客户端 (Client) 的详细步骤。 配置 OAuth2 Server 此部分说明如何将一个 Drupal 实例配置为 OAuth2 提供商,使其能够颁发访问令牌。 步骤一:安装所需模块 * 使用 Composer 安装 Simple OAuth 模块及其依…

先把drupal实例转换为mcp服务器吧
把drupal实例转换为mcp服务器,也就是implement MCP到一个drupal实例。 如下内容为AI撰写,可能有错。我还没有仔细来审阅 将Drupal实例转换为MCP服务器的实施指南 本文档详细描述了将一个标准的Drupal实例配置为任务控制平台(Mission Control Platform, MCP)服务器的步骤、所需模块以及相关注意事项。MCP服务器作为一个中心枢纽,用于集中管理、监控和操作多个Drupal客户端站点。 核心概念 MCP 服务器 (MCP Server) 一个专门配置的Drupal实例,作为中央控制台。它负责接收来自客户端站点的数据,向客户端发送指令,并提供一…

本地文档识别页数比较多的PDF出现了资源消耗问题
本地文档识别页数比较多的PDF出现了资源消耗问题,我们必须变更和简化实现RAG化drupal file attachements的方式。 黄仁勋说邮件TL;DR。我觉得在我们构建RAG的时候,pdf也是一样。 我们用其他方式来实现pdf2text,而在drupal里面这样的方式有很多。 Drupal中实现PDF转文本的替代方案 为解决服务器资源消耗问题并优化性能,可以采用以下几种策略将PDF内容转换为文本。 方案一:集成外部API服务 将PDF解析的繁重任务外包给专业的第三方云服务。这种方法可以显著降低本地服务器的CPU和内存消耗,尤其适合处理大量或复杂的PDF文件。通过API调用,将文件发送…

1 Drupal的知识库化 RAG—ready Drupal
如下内容全部由AI生成。AI生成的所谓技术栈和一些内容对于当前的drupal 11.2已经有点过时了,不过大部分还是能用的。 Drupal AI 知识库化开发计划:构建 RAG-Ready 企业级知识平台 基于关于Drupal开发的定位一文的探讨,为将 Drupal 平台提升为现代化、智能化的企业核心资产,特制定本开发计划。核心目标是将 Drupal 改造为一个支持检索增强生成(Retrieval-Augmented Generation, RAG)的 AI 知识库。 项目愿景与目标 最终愿景: 将 Drupal 从一个传统的内容管理系统(CMS)转变为一个智能、可交互的企业级知识中枢。该平台…

关于DRUPAL开发的定位
感觉drupal这么弹性的框架,可以承载很多种AI时代的开发目标。 最基本的,做一个企业级的知识管理库是完全没有问题的,而且有了这个只是管理库,和各种AI工具的加持,如果再加上工作流和自动化,可以开发出来很多服务。以前只能把它当做一个博客和一个网页内容管理系统,现在感觉完全不同了。 只是可惜感觉php现在性能有些拉胯,而且php-fpm不是基于events的,高了个frankenPHP还是用go和caddy实现,关键是drupal 11还没有官方支持frankenPHP。 如下内容为AI续写 不过,这种对性能的焦虑,或许也从侧面反映出大家对Drupal寄予了更高的期望。它不再仅仅…

增加了内容转MD文本格式功能
开发日记:新增内容转Markdown文本格式功能 为了提升内容的便携性和可复用性,本次开发任务旨在为网站增加一项新功能:将已发布的文章内容转换为标准的Markdown文本格式。这使得内容可以轻松地导出到其他平台,或用于本地存档。该功能主要依赖Drupal社区的优秀模块 Markdownify 来实现。 核心模块:Markdownify 本次功能的核心是利用了 Markdownify 这个Drupal模块。该模块提供了一个强大的服务,可以将HTML文本精准地转换为Markdown格式。它底层使用了 `league/html-to-markdown` PHP库,确保了转换的质量和可靠性。 开发实施…

进一步引入更多的AI模型供应商
进一步引入更多的模型供应商 工作日志:项目 Alpha 核心任务:扩展现有 AI 集成框架,支持多个模型供应商,降低对单一供应商的依赖,并为不同应用场景提供最佳模型选择。 上午:需求分析与技术选型 当前状态:系统深度集成 OpenAI API,用于内容生成与摘要。但成本与可用性成为潜在瓶颈。 新供应商调研: Anthropic (Claude): 优势在于长文本处理和更细致的对话控制,适合用于文档分析和复杂的客户支持机器人。 Google (Gemini): 强大的多模态能力是其亮点,可为未来的图像内容分析功能提供支持。 本地化模型 (via Ollama): 对于处理敏感数据或需要确保最高数…
留学专家王觉菊老师的几篇重要文章
https://wangjueju.cn/zh-hans/blog/zhongguojingjimeiyoutonghuopengzhangzhiyouwujiashangzhang https://wangjueju.cn/zh-hans/blog/zhongguojingjidezhuyaofengxian-shenmehuirangzhongguojingjimianlinjijuhuaposhenzhiduanlequlu https://wangjueju.cn/zh-hans/blog/zhouyijian https://wangjueju.cn/zh-hans/b…

《我看中国大学的教育现状》在华尔街日报中文版网站被刊发之后引起的评论
《我看中国大学的教育现状》在华尔街日报中文版网站被刊发之后,也引起了不少的评论,它在本博上原来是针对华尔街日报中文版的一篇文章《中国大学扩招易 学生就业难》而作的一个短评。这我我再把它和它在华尔街日报中文版网站上获得的评论一起整理出来,当做一个存档吧。特别是WSJ经常被墙的情况下。 2014年5月1日:华尔街日报中文网这篇文章的链接得翻墙才能看到了。真是让我很高兴呀。 五年前的文章了,可是,现在的状况有什么改善么?没有,中国经济的兴奋剂依赖症,不是还在么?调控调控,调了几届了,还是走老路来的舒服。引鸩止渴,爽且速衰呀。经济结构调整不力,高知就业就是狗屁呗。创业也舍不得促进,贷款贷…