WEBVTT

00:00.331 --> 00:15.889
[SPEAKER_00]: BearTalk狗兄有话说AI科技每日兼讯Hello你好欢迎收听BearTalkAI版节目我是大狗兄的智能提升本期节目由我们BearTalkAgent团队为您收集整理、验证、制作

00:16.770 --> 00:32.223
[SPEAKER_00]: 帮助您在宣销的造型中補捉到最有价值的信号下面是本期节目的主要内容两个设置改变了分数翻了三倍今天五件事MCP有了一个竞台版本提示词终于有了版本控制

00:33.243 --> 00:56.899
[SPEAKER_00]: Hackingface被入侵了但不是你想的那种方式有人在重新定义什么叫编写整个软件还有一篇讲复理工程的文章和前媒关系OpenAI两个参数分数分数分三倍这篇来自OpenAI官方博客标题是HowenablingtosettingstripletoourscoresonthearcAGI3benchmark

00:57.419 --> 01:21.587
[SPEAKER_00]: 你以为AI能力要大复体声需要重新训练模型未必有时候你只需要换两颗参数的开关ARCAGI3是目前最受关注的AI通用能力测试之一还用视觉媒体来考验模型真正的推理能力因为那些媒体很难靠被过答案来通过

01:22.207 --> 01:38.388
[SPEAKER_00]: OpenAI在这个绑弹上的GPT5.6色用官方标准测试框架跑出来的成绩对大多数题目来说并不亮眼很多前眼模型都没办法解出第一关以上的迷题然后OpenAI换了一套测试框架开起了两个选项

01:39.730 --> 02:06.000
[SPEAKER_00]: 一個是在API裡保留推力過程另一個是起用警索模式讓模型在推力量過程時能主動壓縮上下文避免超出窗口限制結果同一個模型同一批迷題分數直接翻了三倍一到以前沒有任何前央模型能解到第二關的迷題掃解出了全部六關這說明了什麼?

02:06.140 --> 02:30.423
[SPEAKER_00]: 模型的实际能力和测量出来的能力之间存在一个很大的抗戏这个抗戏的根源是测试框架没有给模型足够的运行空间和模型本身的强弱无关就像你让一个工程师解一道复杂数学题但只给它一张便利贴写草稿当然算不出来换成白板答案就出来了

02:30.983 --> 02:48.158
[SPEAKER_00]: 这件事对从业者的意义很实在极转测试的分数从来都不只是模型的分数也是测试环境的分数你在自己产品里调用同一个模型但用了不同的上下文测略不同的工具配置结果可能天差地别

02:48.838 --> 03:16.915
[SPEAKER_00]: 更深一層这件事提示了一个设计者学在代理系统里你要给模型足够的工作空间推理能不能被保留上下文能不能被压缩延续不是技术细节是影响能力上限的加过决策同一个模型放在合适的环境里就可以解决以前解不了的问题平景经常不在模型本身你可以回头看一下你现在的API调用配置确认推理记录有没有被保留下来

03:17.475 --> 03:37.085
[SPEAKER_00]: 上下文超线时有没有降级策略试试对同一个任务用更充与的上下文策略重跑一遍看看结果是否明显不同StatelessMCPSimonWillison的工具宣报吧这篇来自SimonWillison的个人继续播客王职是SimonWillison.net

03:37.345 --> 03:58.123
[SPEAKER_00]: 原文標題是StatelessMCPhasrecapturedmyinterest你可能聽過MCP,也就是ModelContactsProtocol一個讓AI代理調用外部工具的協議標準大多數人覺得這是純粹的工程實話題跟設計時和創作者沒關係但這次的升級改變了一個很根本的東西

03:58.763 --> 04:14.381
[SPEAKER_00]: mcp的舊版本是有狀態的什麼意思呢就是客戶端核夫期之間需要維持一條持續存在的連接有點像打電話你和對方要同時再現通話才能繼續這個部署帶來了很大的麻煩

04:14.801 --> 04:38.617
[SPEAKER_00]: 工具服务需要一直開著配置負責調師困難MCP2.0也就是2000.26年7月28日的新規範切換到了無狀態模式現在每次AI發出工具調用請求都是一次獨立的HTTP請求像發短性不像打電話服务器處理完就關閉不需要維持常連接

04:40.678 --> 04:57.676
[SPEAKER_00]: 三文物的使用新规犯做了两个工具一个叫mcpexplorer可以帮你探索和调视mcp夫妻另一个是datasetmcp把它自己开发的dataset数据哭工具接近了mcp

04:58.957 --> 05:24.237
[SPEAKER_00]: 他的感受是无状态设计让任何人都可以在15分钟内把自己的小工具接近AI代理这件事变得真实可行了对创作者和设计事来说这意味着什么你不需要懂复欺运为也不需要为会一个一直在线的进场你只需要写一个能想应情求的寒数人到任何地方部署AI就能调用它工具生态的门砍正在快速降低

05:25.038 --> 05:40.205
[SPEAKER_00]: 这和产品设计也有直接关系无状态意味着可组合可组合意味着你能把不同来源的工具自由拼接而不需要他们相互认识这和微服的哲学是一卖相承的只过现在对象是AI代理

05:40.905 --> 06:06.570
[SPEAKER_00]: 无状态不只是工程上的简化它是一种让工具生态真正开放的前提你可以去看三门的MCPExplorer用它检查一下你目前依赖的工具服务有没有按MCP2.0规范更新如果你有任何自己常用的小交本或数据处理工具可以适着把它包成一个简单的MCP服务看看AI能不能直接用起来

06:07.490 --> 06:33.567
[SPEAKER_00]: HawkingFace入侵事件凌信任为什么没有防助测向移动这篇来自TaleScale官方博客原文标题是TaleScale登stop的HawkingFaceIntrusion先说结论TaleScale在标题里自己承认自己没能阻止这次入侵这不是一篇变解文这是一篇非常罕见的公司主动解抛自身局限性的技术复盘

06:34.207 --> 06:52.278
[SPEAKER_00]: HaginFace几周前遭遇了一次嚴重入侵攻击者在他们的系统里前附了4,000半執行了大约17,600的动作包括沙香桃义、代码執行却取云夫评剧最后利用TalesGo的网络在组织内部进行横向移动

06:53.659 --> 07:13.679
[SPEAKER_00]: Talescale主打的是零性任網絡聽起來應該能防助這種事但問題在於零性任的核心邏輯是不信任網絡位置只信任身份Talescale做到了這一點他驗證了設備和用戶的身份但攻擊者獲取的正是一個合法身份的平劇

07:14.259 --> 07:38.807
[SPEAKER_00]: 身份是对的动作在全线範围内Talesca有没有理由拒绝这就像你家装了最好的门所但有人拿到了要时所没有问题要时管理才是问题Talesca有在文章里指出真正需要的是更细理度的访问控制让合法身份也不能在整个网络里随意恨疑这叫最小全线原则和零性认识配套关系两者缺疑不可

07:39.427 --> 08:08.613
[SPEAKER_00]: 這件事對AI工具使用者的啟示更直接我們現在給AI代理配置各種API-K數據庫訪問雲副全線全線範圍往往比實際需要宽飯的多因為反正是自己用但一旦某個環節出問題這個宽飯的全線就是攻擊者的跑馬場安全靠的是一層層跌加的摩擦每一層都不是萬能的但每一層都讓攻擊者多副出一點代價

08:09.313 --> 08:29.248
[SPEAKER_00]: 你可以今天就檢查一下你給AI工具配置的各種頭肯和T確認他們的全線範圍是否超過了實際需要是只為不同的任務設置獨立的全線最小化的平劇而不是供用一個全能TMirrorCodeAI能從頭寫完一個完整程序嗎?

08:29.408 --> 08:35.893
[SPEAKER_00]: 这篇来自依捧Ai,原门标题是MirrorCode,What'sthelargestsoftwareprojectA.I.

08:35.893 --> 08:49.903
[SPEAKER_00]: cancompleteonitsown.这是依捧和Mature,联合发布的新机转测试。通常我们说Ai会写代码,值得是,秀一个bug,实现一个寒书,帮你補权几行。

08:50.023 --> 09:06.631
[SPEAKER_00]: Miracle的问的是另一个层次的问题AI能不能在不看原始代码的情况下从零副现一个完整的程序并且通过所有测试包括隐藏测试任务的难度在于AI必须同事理解需求的全居结构

09:07.892 --> 09:28.678
[SPEAKER_00]: 规划模块之间的依賴关系处理边界情况还要让最终输出和原始程序的行为精确匹配这更接近一个实际的软件工程项目而不是一道算法体Miracle的包含25个目标程序快乐Unix工具数据处理网络协议等不同领域

09:29.418 --> 09:54.137
[SPEAKER_00]: 目前的测试结果是现有签业模型能完成其中一部分叫短的任务但最复杂的程序还没有模型能够独立完成这是好消息意味着AI取代整个软件团队这件实在20026年夏天还没有发生但趋势比结果更重要三年前AI在任何类似的长洲期变成任务场的完成率接近予灵

09:54.737 --> 10:21.535
[SPEAKER_00]: 今天他可以完成部分程序这条曲线如果继续真正在擴大的是可以独立交付软件的战元规模对产品设计是来说这个信号意味着设计和需求表达的质量将成为AI交付质量的上线你把一个程序的期望行为描述的月金确AI越有可能给你一个可用的结果抹糊的需求仍然会产生抹糊的代码

10:22.015 --> 10:43.313
[SPEAKER_00]: AI能从头写完一个程序但它用的是你给的地图地图画的月清除它迷路的可能性就越小你可以找一个你熟悉的小工具或脚本试指用自然语言把它的完整行为写成一份说明然后让AI从头实现看看差距在哪里差距出现在哪个复杂度节点

10:44.033 --> 11:06.321
[SPEAKER_00]: 把这个练习当成一次需求表达能力的自我测试负力工程让每一行代码都让下一行更容易写这篇来自Every2原文标题是ConPodEngineering作者是Every团队的工程事件分享来源性质独立媒体团队的方法论文章属于本期观点篇配合

11:07.341 --> 11:23.596
[SPEAKER_00]: 大多数人对技术宰的理解是带马写多了系统会变得越来越难改这个判断是对的但他只描述了问题没有告诉你为什么以及怎么避免复理工程给出了一个不一样的框架普通的工程方式是加法

11:24.817 --> 11:44.731
[SPEAKER_00]: 每个功能堆上去和一有的部分谈判共存时间长了系统变成一团互相签致的网改哪里都会签动别处复理工程的邏輯是交每次罢个修复不只是消除一个罢个而是让整类罢个不再可能出现

11:45.391 --> 12:03.801
[SPEAKER_00]: 每一個新功能不只是加了一個能力而是給系統注入了一種可以被後續功能負用的規則換個比方普通工程向蓋專房每塊專加上許多增加重量負力工程向寫資點每個資條加進去都讓下一個資條更容易被理解和應用

12:04.561 --> 12:22.094
[SPEAKER_00]: 這個框架對AI時代的工作流有直接硬設現在很多人用AI聲稱代碼速度快但聲稱的代碼往往是加法式的缺乏內部一致性沒有被設計成可復用的單元短七效率高但幾個月後維護成本會反彈

12:22.783 --> 12:37.312
[SPEAKER_00]: 副立工程真正要问的核心问题是这个功能能不能让下一个功能更好做把这个问题带进AI扶住开发里你就会开始问我要求AI生成的这段代码有没有遵循我系统里一有的模式

12:37.992 --> 12:57.690
[SPEAKER_00]: 他有沒有讓整個代馬庫更一致,還是更混亂,這不只是工程哲學,對任何需要激累的創作工作都成立每一篇文章有沒有讓下一篇更容易寫,每一個設計決策有沒有讓下一個決策更清晰,副立的邏輯,是所有需要持續疊待的系統的底層預法

12:58.050 --> 13:25.591
[SPEAKER_00]: 每一次工作问自己这件事做完之后下一次类似的事情会更容易还是更难你可以在下次用AI生成贷马之前先花5分钟把你系统理的命名规范和模式整理成一段上下文给AI作为参考是者给你的贷马库建立分决策日制记录为什么这样设计让AI和你自己未来都能读懂今天几件事各有方向

13:26.611 --> 13:52.860
[SPEAKER_00]: 测识分数是环境的寒属,不只是模型的寒属,工具协议越来越轻,入口越来越低,安全是模擦的跌架,不只是一道门。AI能写多大的程序,边界还在移动。每一件工作都可以是下一件工作的养料。今天提到的所有原文练界都在节目的收贸自己,保持好奇,我们明天继续,感谢您的收听。

13:53.222 --> 14:03.086
[SPEAKER_00]: 有任何建議意見,請在X也就是推特上與Bear6聯繫本節目還會繼續進化,請保持期待,我們明天再見!

